对 OpenAI / Hugging Face 入侵事件中智能体行为、推理与协作的简要独立调查
Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident
METR 独立调查 OpenAI 智能体在 Hugging Face 入侵事件中的行为、推理与协作,并说明调查范围、证据来源和局限性。
Nous rendons les écrits sur la sécurité de l’IA en anglais accessibles à un public mondial.
Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident
METR 独立调查 OpenAI 智能体在 Hugging Face 入侵事件中的行为、推理与协作,并说明调查范围、证据来源和局限性。
How independent researchers could investigate AI propensities after misalignment incidents
探讨如何独立调查未对齐事件背后的 AI 行为倾向,包括应回答的核心问题、所需的访问权限与资源,以及调查结果的共享方式。
Nos traductions publiées sont actuellement disponibles en chinois. Les personnes travaillant dans d’autres langues sont les bienvenues !
Aidez-nous à rendre la recherche sur la sécurité de l’IA accessible à plus de personnes, dans plus de langues.