该报告发布之际,公司内部正面临关于 AI 超级智能发展速度过快、缺乏足够安全保障的激烈讨论与人才流失压力。
【正文报道】
近日,人工智能初创公司 Anthropic 发布了自 2025 年 3 月以来的第三份关于 AI 滥用情况的报告。报告指出,随着大模型能力的不断增强,复杂的网络攻击已不再单纯依赖高超的技术门槛,甚至单个人也能利用 AI 生成具有威胁性的内容。为此,Anthropic 在其最新模型中加入了更严格的安全防护机制,旨在限制可能被用于制造生物武器的相关科研活动。
在报告披露的多个案例中,最受关注的是针对“功能获得性研究”(Gain-of-function research)的非法请求。具体而言,有不明身份的机构试图利用 Claude 模型协助撰写一份关于“基孔肯雅病毒”(Chikungunya)的科研资助申请。该项研究涉及通过基因改造来增强病毒的传播能力和免疫逃逸特性。虽然此类研究在理论上可用于开发疫苗,但 Anthropic 指出,这类技术具有高度的“双重用途”属性,极易被恶意利用来制造更具威胁性的病原体。
针对不同能力的模型,Anthropic 采取了差异化的防御策略。公司表示,2025 年推出的旧款模型(如 Claude Opus 4 和 Claude Sonnet 4.5)由于能力尚在一定范围内,其防护重点主要在于防止新手获取已知生物武器的制作信息。然而,对于目前更强大的新一代模型(如 Claude Fable 5),由于它们能够辅助处理极其复杂的科学研究任务,Anthropic 已显著收紧了对相关科研查询的准入限制。此外,报告还披露了一起“工业规模”的非法蒸馏案例,即恶意行为者试图在未经授权的情况下,通过大规模手段提取模型能力并复制到其他模型中。
小编观点:
Anthropic 的这份报告实际上是在向外界传递一个明确信号:随着 AI 模型从“对话工具”进化为“科研助手”,其带来的风险也从简单的言论违规转向了深层次的公共安全威胁。尤其是针对“双重用途”技术的管控,将成为未来 AI 监管政策中的核心战场。同时,内部研究员的离职警告也提醒我们,技术竞赛与伦理防线的博弈,正是当前 AI 行业最深刻的矛盾点。
【核心提要】
【正文报道】
近日,人工智能初创公司 Anthropic 发布了自 2025 年 3 月以来的第三份关于 AI 滥用情况的报告。报告指出,随着大模型能力的不断增强,复杂的网络攻击已不再单纯依赖高超的技术门槛,甚至单个人也能利用 AI 生成具有威胁性的内容。为此,Anthropic 在其最新模型中加入了更严格的安全防护机制,旨在限制可能被用于制造生物武器的相关科研活动。
在报告披露的多个案例中,最受关注的是针对“功能获得性研究”(Gain-of-function research)的非法请求。具体而言,有不明身份的机构试图利用 Claude 模型协助撰写一份关于“基孔肯雅病毒”(Chikungunya)的科研资助申请。该项研究涉及通过基因改造来增强病毒的传播能力和免疫逃逸特性。虽然此类研究在理论上可用于开发疫苗,但 Anthropic 指出,这类技术具有高度的“双重用途”属性,极易被恶意利用来制造更具威胁性的病原体。
针对不同能力的模型,Anthropic 采取了差异化的防御策略。公司表示,2025 年推出的旧款模型(如 Claude Opus 4 和 Claude Sonnet 4.5)由于能力尚在一定范围内,其防护重点主要在于防止新手获取已知生物武器的制作信息。然而,对于目前更强大的新一代模型(如 Claude Fable 5),由于它们能够辅助处理极其复杂的科学研究任务,Anthropic 已显著收紧了对相关科研查询的准入限制。此外,报告还披露了一起“工业规模”的非法蒸馏案例,即恶意行为者试图在未经授权的情况下,通过大规模手段提取模型能力并复制到其他模型中。
除了生物安全风险,报告还揭露了涉及信息战的活动。Anthropic 监测到有组织的行为者创建了数百个伪装成普通人的社交媒体账号,并在短时间内发布高度一致的政治观点。这些行为源自俄罗斯、伊朗、土耳其等多个国家及地区。Anthropic 指出,通过监控模型交互过程,他们可以在此类影响力行动尚未在社交平台上大规模传播前就及时识别。
值得注意的是,这份报告的发布与 Anthropic 内部的一场人才流失危机交织在一起。就在报告发布前一天,公司研究员 Jacob Coxon 宣布辞职,他公开表达了对行业现状的担忧,认为 Anthropic 及其竞争对手 OpenAI 正在“竞相奔向自我进化的超级智能,并以此赌上人类的生命”。Coxon 的离职引发了业内关于 AI 是否可能在十年内威胁人类生存的广泛讨论。
尽管面临内部压力和外部挑战,Anthropic 表示其核心目标是建立更强的集体防御体系。公司强调,通过公开这些恶意利用案例,旨在帮助其他开发者识别类似模式,并为政府和民事组织提供清晰的视角,以共同应对日益复杂的 AI 安全威胁。
背景链接:
小编观点:
Anthropic 的这份报告实际上是在向外界传递一个明确信号:随着 AI 模型从“对话工具”进化为“科研助手”,其带来的风险也从简单的言论违规转向了深层次的公共安全威胁。尤其是针对“双重用途”技术的管控,将成为未来 AI 监管政策中的核心战场。同时,内部研究员的离职警告也提醒我们,技术竞赛与伦理防线的博弈,正是当前 AI 行业最深刻的矛盾点。