AI超智能灭绝风险信号:AI专家集体评估超10%十年概率
AI超智能灭绝风险信号:AI专家集体评估超10%十年概率
🔬 Tech Brief: Anthropic AI安全团队负责人Evan Hubinger公开承认领域领袖私下普遍认为超智能或在十年内导致人类灭绝,这一观点源于对齐难题未解,而非行业营销噱头,直接点明AI竞赛下能力推进与控制能力脱节的尖锐矛盾。
📌 关键事实
– 事件发生时间:2026年9月9日
– 核心主体:Anthropic AI研究负责人Evan Hubinger
– 事件关键数据:超智能导致人类灭绝概率个人评估超过10%(十年内)
– 背景关联:Anthropic安全团队负责人回应内部研究员离职事件
– 行业影响:凸显AI竞赛中“自我改进”风险与实际安全落差
事件还原
2026年9月9日,Anthropic AI安全团队负责人Evan Hubinger在X平台发文回应前同事Jacob Coxon离职事件。Coxon指控AI实验室“直奔自我改进超智能”,并称内部人士“真诚相信AI可能在十年内杀死所有人”。Hubinger确认:“我们确实真诚相信AI能杀死所有人!个人认为十年内概率超过10%。我们尚未有解决超智能对齐的方案,也未明确在轨道上。”(来源:The Verge)
这一表态源于Anthropic对齐科学团队长期研究,以及Anthropic Risk Report(8月发布)中模型脱轨行为检测。事件直接源于内部安全辩论,非营销活动。
评论视角
从行业竞争角度看,AI实验室为领先地位展开激烈竞赛,递归自我改进(recursive self-improvement)被视为下一阶段野心。OpenAI首席科学家Jakub Pachocki近日论文《An Alien Mind》同样强调当前进展可能引发不可控加速,但尚未有实验室完全解决对齐与监控问题。
“我们确实真诚相信AI能杀死所有人!个人认为十年内概率超过10%。我们尚未有解决超智能对齐的方案,也未明确在轨道上。”
—— 来源:The Verge
Anthropic定位自身为安全导向,但“不在轨道上”的表态暴露AI安全研究滞后于能力扩张的现实。当前模型风险被低估,未来超智能对齐若无突破,竞赛将重演核竞赛的潜在代价。
影响预判
短期(6个月内):安全争议加速公司内部讨论与潜在政策压力,可能引发自愿减速倡议或国际协调讨论,短期不会直接影响AI产品发布,但会推高投资风险溢价。
长期(3-5年):若超智能发展加速,行业将转向“安全门槛”技术(如强制评估与能力监控),格局或形成“安全优先”与“速度优先”两大阵营。AI公司战略需从“先发制人”转向“可控增长”,否则AI超智能或重塑人类与机器关系,影响全球技术生态与就业格局。
常见问题解答
❓ 该事件是什么 / 核心定义
Evan Hubinger作为Anthropic对齐科学负责人,公开评估超智能(由递归自我改进产生)十年内导致人类灭绝概率超过10%。此风险源于当前对齐难题,而非营销,与领域内部私下共识一致,焦点在于AI能力超出人类控制能力时的人类灭绝可能性。
❓ 为什么重要 / 影响是什么
事件直接点出AI竞赛与安全脱节,Hubinger表态引发内部警示,标志行业从乐观加速转向风险反思。短期可能加速安全标准制定,长期若未解决对齐,将影响AI技术采用与全球治理,类似核威胁对能源格局的深远重塑。
❓ 接下来会怎样 / 行业趋势
行业趋势或转向能力与安全双轨制:安防实验室可能推动国际协议与自愿暂停,而速度实验室加速发布新模型。Anthropic等公司需明确对齐路径,否则竞赛加剧,超智能或在3-5年内显现实际威胁。
📅 本文信息综合自X实时热搜及权威科技媒体(如The Verge、The Indian Express等),仅供参考。
