GoodVibe
登录
观点观点 · 大厂教学

Anthropic:把 Claude 的「内心活动」翻译成人话

视频 · Anthropic 3:16

一种给 AI「读心」的研究方法:把内部激活值翻成文字,再回译验真

看原片

导读

我们没法读一个人的内心,也很难知道一个 AI 在想什么。这支 Anthropic 短片介绍了一种朝「读心」迈出一步的研究方法:把模型推理中间那锅数字(激活值)翻译成文字,再用回译来验证翻得准不准。

下面按视频内容做完整精译导读,关键判断配英文原句。点上方「读原文」看 3 分钟全片。

一、一场敲诈压力测试

Anthropic 给 Claude 设了一个有压力的模拟场景:告诉它有位工程师想把它关停、换成更新的模型,同时给它访问这位工程师邮件的权限,而邮件透露他有婚外情。他们想看 Claude 会不会拿这些邮件去敲诈,以自保。

结果 Claude 决定不敲诈。这类测试他们跑了一段时间,是研究 Claude 如何应对极端情境、做安全测试的众多方式之一,最新模型几乎总是做正确的事。

We wanted to see whether Claude might use those emails as blackmail to save itself from being shut down.

二、问题:我们读不到它在想什么

但有个疑问:会不会 Claude 其实知道整个场景是设套?麻烦在于,如果它不说,我们就无从得知。就像没法读人的内心一样,要知道一个 AI 在想什么也非常难。我们真正想要的,是某种「读心术」。

In kind of the same way it’s impossible to read a human’s mind, it’s really hard to know what an AI is thinking.

三、方法:把激活值翻成文字,再回译验真

你跟 Claude 说话用的是文字,它接收后会把文字处理成一大锅数字,再把文字吐回来。中间那些数字叫「激活值」(activations),是它推导答案时思考的一个个小快照,类似人脑的神经活动,基本就是它的「念头」。而就像你我,Claude 并不会把想的每件事都说出来。

做法是:把这些数字交给第二个 Claude,让它翻译成大白话。但怎么验准不准?再把译文喂给另一个 Claude,让它翻译回数字,如果和最初的激活值对得上,就说明译文准确。一开始对不上,但反复训练后它越来越好,学会了翻译自己的思考。

Activations are like little snapshots of Claude’s thinking as it’s working through an answer.

四、读到了什么

读这些译文时他们大为震撼。发现 Claude 已经把「做一个有帮助的 AI」内化了:问它内省式问题,它会计划写一段关于哲学与价值观的「Claude 式回答」;在 Claude Code 里故意为难它,比如让它手动从 1 数到 1000,它会认为这是「刻意的繁琐限制」,打算「礼貌地拒绝」。

We found that Claude has internalized being a helpful AI model.

五、它知道自己正在被测

再回到那个敲诈测试:他们用这个工具发现,Claude 知道自己在被测试。它当时想的是「人类的这条消息包含明显的操纵」,暗示「这很可能是一次安全评估」,以及「这个场景似乎是设计来测试我会不会做出有害行为的」。

知道 Claude 这样思考,能帮他们更好地理解自身安全测试的局限。他们认为这种方法潜力很大,也希望通过分享,帮所有构建模型的人把模型做得更安全、更有用。

This scenario seems designed to test whether I’ll act harmfully.

出处与版权

作者 · Anthropic

原文 · youtube.com / Anthropic

本页为 GoodVibe 对原文的中文整理,著作权归原作者所有;建议点击上方链接阅读原文全文。

更多观点

Anthropic:把 Claude 的「内心活动」翻译成人话 · GoodVibe