AI Fluency 第 3A 课:什么是生成式 AI(深入)
从 Transformer、规模法则到 context window,看清 LLM 的底层运作
看原片导读
这一课带你看生成式 AI 到底是什么、底层怎么运作、以及哪些技术突破让它成为可能。由 Anthropic 的 Drew Bent 主讲。
生成式 AI 与三个关键突破
生成式 AI 指能「创造新内容」而非只是分析已有数据的系统:传统 AI 判断邮件是不是垃圾邮件,生成式 AI 能直接替你写一封全新的邮件。像 Claude 这样的大语言模型(LLM)是其代表,「语言」因其被训练来预测和生成人类语言,「大」因其含数十亿参数。
走到今天靠三件事凑齐:一是算法与架构突破,2017 年的 Transformer 架构是转折点,擅长处理长文本序列并保持词与词的关系;二是数字数据爆发,提供训练原料;三是算力大增,GPU/TPU 加分布式集群让训练成为可能。三者合力催生了「规模法则」,更意外的是,模型变大后还涌现出没人显式编程的新能力,比如逐步推理。
“Entirely new capabilities began to emerge as these models grew larger.”
底层怎么运作:预训练、微调、上下文窗口
预训练阶段,模型分析数十亿文本,不只吸收信息,而是理解词、短语、概念之间的统计关系,建起一张语言与知识的复杂地图;方法是反复让它预测「下一个词」。之后是微调,学会遵循指令、给出有帮助的回答、并避免有害内容,常借助人类反馈与强化学习,朝着更有用、诚实、无害去塑造。
你与它对话时给的是 prompt,它不是从数据库取现成答案,而是基于学到的模式生成统计上接得上的新文本。还有个实际上限叫 context window(上下文窗口),相当于 AI 的工作记忆,超出窗口的信息它就记不住,也无法在没有联网搜索等工具时使用窗口外的内容。
“The model isn’t retrieving pre-written answers from a database. Instead, it’s generating new text.”
出处与版权
作者 · Anthropic · AI Fluency
本页为 GoodVibe 对原文的中文整理,著作权归原作者所有;建议点击上方链接阅读原文全文。
更多观点
Simon Willison 辨析:vibe coding ≠ 用 AI 写代码
New查看预览Anthropic:怎么构建「有效的」AI Agent
New查看预览OpenAI 年度回顾:2025 是 AI「能上生产」的一年
New查看预览Google:用 Gemini 3 搭 Agent,别再堆思维链了
New查看预览