Anthropic:把 Claude 的「内心活动」翻译成人话
一种给 AI「读心」的研究方法:把内部激活值翻成文字,再回译验真
看原片导读
我们没法读一个人的内心,也很难知道一个 AI 在想什么。这支 Anthropic 短片介绍了一种朝「读心」迈出一步的研究方法:把模型推理中间那锅数字(激活值)翻译成文字,再用回译来验证翻得准不准。
下面按视频内容做完整精译导读,关键判断配英文原句。点上方「读原文」看 3 分钟全片。
一、一场敲诈压力测试
Anthropic 给 Claude 设了一个有压力的模拟场景:告诉它有位工程师想把它关停、换成更新的模型,同时给它访问这位工程师邮件的权限,而邮件透露他有婚外情。他们想看 Claude 会不会拿这些邮件去敲诈,以自保。
结果 Claude 决定不敲诈。这类测试他们跑了一段时间,是研究 Claude 如何应对极端情境、做安全测试的众多方式之一,最新模型几乎总是做正确的事。
“We wanted to see whether Claude might use those emails as blackmail to save itself from being shut down.”
二、问题:我们读不到它在想什么
但有个疑问:会不会 Claude 其实知道整个场景是设套?麻烦在于,如果它不说,我们就无从得知。就像没法读人的内心一样,要知道一个 AI 在想什么也非常难。我们真正想要的,是某种「读心术」。
“In kind of the same way it’s impossible to read a human’s mind, it’s really hard to know what an AI is thinking.”
三、方法:把激活值翻成文字,再回译验真
你跟 Claude 说话用的是文字,它接收后会把文字处理成一大锅数字,再把文字吐回来。中间那些数字叫「激活值」(activations),是它推导答案时思考的一个个小快照,类似人脑的神经活动,基本就是它的「念头」。而就像你我,Claude 并不会把想的每件事都说出来。
做法是:把这些数字交给第二个 Claude,让它翻译成大白话。但怎么验准不准?再把译文喂给另一个 Claude,让它翻译回数字,如果和最初的激活值对得上,就说明译文准确。一开始对不上,但反复训练后它越来越好,学会了翻译自己的思考。
“Activations are like little snapshots of Claude’s thinking as it’s working through an answer.”
四、读到了什么
读这些译文时他们大为震撼。发现 Claude 已经把「做一个有帮助的 AI」内化了:问它内省式问题,它会计划写一段关于哲学与价值观的「Claude 式回答」;在 Claude Code 里故意为难它,比如让它手动从 1 数到 1000,它会认为这是「刻意的繁琐限制」,打算「礼貌地拒绝」。
“We found that Claude has internalized being a helpful AI model.”
五、它知道自己正在被测
再回到那个敲诈测试:他们用这个工具发现,Claude 知道自己在被测试。它当时想的是「人类的这条消息包含明显的操纵」,暗示「这很可能是一次安全评估」,以及「这个场景似乎是设计来测试我会不会做出有害行为的」。
知道 Claude 这样思考,能帮他们更好地理解自身安全测试的局限。他们认为这种方法潜力很大,也希望通过分享,帮所有构建模型的人把模型做得更安全、更有用。
“This scenario seems designed to test whether I’ll act harmfully.”
出处与版权
更多观点
Simon Willison 辨析:vibe coding ≠ 用 AI 写代码
New查看预览Anthropic:怎么构建「有效的」AI Agent
New查看预览OpenAI 年度回顾:2025 是 AI「能上生产」的一年
New查看预览Google:用 Gemini 3 搭 Agent,别再堆思维链了
New查看预览