GoodVibe
登录

AI Fluency 第 3A 课:什么是生成式 AI(深入)

视频 · Anthropic · AI Fluency 6:21

从 Transformer、规模法则到 context window,看清 LLM 的底层运作

看原片

导读

这一课带你看生成式 AI 到底是什么、底层怎么运作、以及哪些技术突破让它成为可能。由 Anthropic 的 Drew Bent 主讲。

生成式 AI 与三个关键突破

生成式 AI 指能「创造新内容」而非只是分析已有数据的系统:传统 AI 判断邮件是不是垃圾邮件,生成式 AI 能直接替你写一封全新的邮件。像 Claude 这样的大语言模型(LLM)是其代表,「语言」因其被训练来预测和生成人类语言,「大」因其含数十亿参数。

走到今天靠三件事凑齐:一是算法与架构突破,2017 年的 Transformer 架构是转折点,擅长处理长文本序列并保持词与词的关系;二是数字数据爆发,提供训练原料;三是算力大增,GPU/TPU 加分布式集群让训练成为可能。三者合力催生了「规模法则」,更意外的是,模型变大后还涌现出没人显式编程的新能力,比如逐步推理。

Entirely new capabilities began to emerge as these models grew larger.

底层怎么运作:预训练、微调、上下文窗口

预训练阶段,模型分析数十亿文本,不只吸收信息,而是理解词、短语、概念之间的统计关系,建起一张语言与知识的复杂地图;方法是反复让它预测「下一个词」。之后是微调,学会遵循指令、给出有帮助的回答、并避免有害内容,常借助人类反馈与强化学习,朝着更有用、诚实、无害去塑造。

你与它对话时给的是 prompt,它不是从数据库取现成答案,而是基于学到的模式生成统计上接得上的新文本。还有个实际上限叫 context window(上下文窗口),相当于 AI 的工作记忆,超出窗口的信息它就记不住,也无法在没有联网搜索等工具时使用窗口外的内容。

The model isn’t retrieving pre-written answers from a database. Instead, it’s generating new text.

出处与版权

作者 · Anthropic · AI Fluency

原文 · youtube.com / Anthropic

本页为 GoodVibe 对原文的中文整理,著作权归原作者所有;建议点击上方链接阅读原文全文。

更多观点

AI Fluency 第 3A 课:什么是生成式 AI(深入) · GoodVibe