AI技术的演进和发展
AI 技术的发展历程、关键阶段与未来趋势
学习目标:建立一条“算法架构 → 基础模型 → 外部知识与工具 → 多模态 → 开放生态 → AI 编程 → Agent → AGI”的完整认知链,理解每次技术跃迁解决了什么问题,又引入了什么新限制。
目录
- 总览:AI 演进的核心逻辑
- 2017 年以前:专用 AI 与深度学习崛起
- 2017—2023:Transformer、基础模型与对话式 AI
- 提示工程:用输入控制模型行为
- 2020—至今:RAG、工具调用与 MCP
- 多模态:从语言走向视觉、语音与视频
- 开放权重、蒸馏与垂直领域模型
- AI 编程:从补全到自主软件工程
- Agent:从生成答案到执行任务
- AGI、风险与未来判断
- 总时间线、术语速查、自测题与答案
1. 总览:AI 演进的核心逻辑
AI 的发展不只是“模型越来越大”,而是不断补齐智能系统的能力闭环:
感知输入 → 表示与理解 → 推理与规划 → 调用知识/工具 → 执行动作 → 获取反馈 → 修正策略
| 阶段 | 核心突破 | 主要解决的问题 | 新暴露的问题 |
|---|---|---|---|
| 专用 AI | 机器学习、深度学习 | 从数据中学习单一任务 | 泛化弱、开发门槛高 |
| Transformer | 自注意力、并行训练 | 长距离依赖和训练效率 | 数据与算力需求巨大 |
| 大语言模型 | 预训练、规模化、指令对齐 | 一个模型处理多类语言任务 | 幻觉、知识截止、不可控 |
| RAG / 工具调用 | 外部检索与函数接口 | 接入私有知识和真实能力 | 检索质量、工具安全、工程复杂度 |
| 多模态 | 跨模态表示与生成 | 理解和生成图文音视频 | 一致性、物理规律、版权与伪造 |
| Agent | 规划、记忆、工具、反馈循环 | 持续完成多步骤任务 | 错误累积、成本、权限与可靠性 |
一句话主线:AI 从“为一个任务训练一个模型”,逐步走向“以基础模型为认知核心,连接知识、工具和环境,自主完成目标”。
2. 2017 年以前:专用 AI 与深度学习崛起
2.1 基础概念
| 概念 | 定义 | 关系或例子 |
|---|---|---|
| AI(Artificial Intelligence) | 让机器表现出感知、理解、推理、决策、学习或生成能力的总称 | 最大的概念集合 |
| ML(Machine Learning) | 让系统从数据中学习规律,而非完全依靠人工规则 | AI 的主要实现路径之一 |
| DL(Deep Learning) | 使用多层神经网络学习复杂表示 | ML 的子集 |
| NLP | 处理、理解和生成人类语言 | 翻译、分类、问答、摘要 |
| CV | 从图像或视频中提取语义 | 分类、检测、分割、OCR |
| ASR | Automatic Speech Recognition,语音转文字 | 与语音合成 TTS 方向相反 |
| RL | 智能体通过状态、动作和奖励信号学习策略 | 游戏、机器人控制、模型后训练 |
表示学习是深度学习成功的关键:模型不再完全依赖人类手工设计特征,而是从原始数据中自动学习有用的内部表示。
2.2 传统方法到深度学习
传统机器学习常见流程是:人工提取特征 → 选择算法 → 训练分类器。比如垃圾邮件识别会人为统计关键词、词频和发送者特征。深度学习则把“特征提取”和“任务学习”放进同一个神经网络中联合优化。
| 维度 | 传统机器学习 | 深度学习 |
|---|---|---|
| 特征 | 依赖人工设计 | 自动学习多层表示 |
| 数据规模 | 中小规模也可工作 | 通常更依赖大量数据 |
| 算力需求 | 相对较低 | GPU/TPU 等并行算力需求高 |
| 可解释性 | 部分算法较强 | 通常较弱 |
| 典型模型 | 决策树、SVM、逻辑回归 | CNN、RNN、Transformer |
2.3 为什么早期 AI 多为“专才”
- 任务定义狭窄:情感分类、机器翻译和图像识别通常分别训练。
- 数据彼此割裂:标注数据昂贵,不同任务的数据格式也不同。
- 模型迁移能力有限:在一个数据集上学到的能力难以直接用于另一任务。
- 交互方式工程化:用户面对的是按钮、接口和规则,而不是通用自然语言入口。
3. 2017—2023:Transformer、基础模型与对话式 AI
3.1 Transformer 解决了什么
2017 年论文《Attention Is All You Need》提出 Transformer。它是一种神经网络架构,不是某个具体产品或单一模型。
此前 NLP 常使用 RNN/LSTM:信息按词序逐步传递,天然适合序列,但训练难以充分并行,长距离信息也可能衰减。Transformer 主要依靠自注意力,让每个 token 根据任务需要聚合序列中其他 token 的信息。
自注意力可简化表示为:
$$
\operatorname{Attention}(Q,K,V)=\operatorname{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V
$$
- Query(Q):当前 token 想寻找什么信息。
- Key(K):每个 token 可供匹配的索引。
- Value(V):匹配后真正聚合的内容。
- 多头注意力:让不同注意力头同时学习语法、指代、位置或语义等关系。
| 对比维度 | RNN/LSTM | Transformer |
|---|---|---|
| 计算方式 | 顺序递归 | 训练阶段高度并行 |
| 长距离依赖 | 信息需多步传递 | token 间可直接建立注意力关系 |
| 扩展性 | 大规模训练受限 | 更适合扩大参数、数据与算力 |
| 主要代价 | 长序列记忆困难 | 标准注意力计算量随序列长度近似平方增长 |
3.2 从语言模型到大型语言模型
语言模型的基本任务是根据已有 token 预测后续 token,或恢复被遮盖的 token。通过在海量文本上进行自监督预训练,模型会压缩语言规律、事实关联、写作模式以及一定的推理模式。
LLM 的能力通常来自三层训练:
- 预训练(Pre-training):学习通用语言和世界知识,成本最高。
- 监督式指令微调(SFT):用“指令—理想回答”数据教模型遵循任务。
- 偏好对齐:使用 RLHF、RLAIF 或直接偏好优化等方法,使回答更有帮助、更安全、更符合人类偏好。
训练大模型的关键要素:架构、数据、算力、训练算法、评测与工程系统。原稿中的“架构 + 数据 + 算力”是重要概括,但并不完整。
3.3 ChatGPT 为什么成为转折点
2022 年 11 月发布的 ChatGPT 并不是第一个语言模型,也不是第一个聊天机器人。它的突破在于把较强的基础模型、指令对齐、对话界面和低门槛产品体验组合起来,让普通用户能用自然语言直接调用模型能力。
| 层次 | 作用 |
|---|---|
| 基础模型 | 提供语言、知识、生成和一定推理能力 |
| 指令微调 | 理解“总结、比较、改写、写代码”等任务形式 |
| 人类反馈对齐 | 改善帮助性、安全性和对话风格 |
| 对话产品 | 保存上下文、降低使用门槛、形成反馈循环 |
3.4 涌现能力:应谨慎理解
所谓涌现能力(Emergent Abilities),是指某些任务表现在规模扩大后出现明显跃升,例如少样本学习、代码生成或复杂推理。但“突然出现”有时也与评测指标不连续、提示方式或任务难度有关。
常见能力包括:
- 上下文学习(In-context Learning):仅靠当前上下文里的说明和示例完成新任务,不等于更新模型参数。
- 零样本/少样本学习:没有示例或只有少量示例时执行任务。
- 代码生成与工具选择:生成程序或结构化工具参数。
- 复杂推理:在数学、逻辑和规划任务中生成中间步骤,但步骤可能貌似合理而实际错误。
4. 提示工程:用输入控制模型行为
提示工程(Prompt Engineering)是设计模型输入,以提高输出质量、稳定性和可控性的方法。它不修改模型参数,属于推理阶段控制。
4.1 一个实用提示结构
角色/背景:你在什么情境中工作
目标:最终要产出什么
输入:模型需要处理的材料
约束:范围、格式、语气、禁止事项
评判标准:什么算高质量
示例:必要时给一到三个输入输出示范
4.2 常见策略
| 策略 | 适用场景 | 注意事项 |
|---|---|---|
| 明确任务与边界 | 几乎所有任务 | 避免“帮我优化一下”这类模糊目标 |
| 提供参考材料 | 总结、抽取、问答 | 要求模型区分材料事实与外部推断 |
| Few-shot 示例 | 固定风格、分类、结构化抽取 | 示例质量比数量更重要 |
| 结构化输出 | 需要程序继续处理 | 使用 JSON Schema 或固定表格字段 |
| 拆分复杂任务 | 研究、规划、长文写作 | 每一步设置验收条件 |
| 自检/评审 | 高要求产出 | 不能替代外部验证和人工审核 |
5. 2020—至今:RAG、工具调用与 MCP
LLM 有两类结构性短板:模型参数中的知识可能过时或缺失;仅生成文本无法直接查询数据库、发送请求或操作软件。RAG 主要补“知识”,工具调用主要补“行动”。
5.1 RAG:把外部知识放进当前上下文
RAG(Retrieval-Augmented Generation)是在生成前检索相关资料,并把结果提供给模型作为回答依据。
典型流程:
文档采集 → 清洗与切分 → Embedding 向量化 → 建立索引
用户问题 → 查询改写 → 召回候选 → 重排 → 拼接上下文 → LLM 生成 → 引用/评估
Embedding 把文本映射为向量,使语义相近的内容在向量空间中更接近。实际系统常结合向量检索与关键词检索,再使用重排模型提高相关性。
| RAG 优势 | 对应限制 |
|---|---|
| 知识更新不必重新训练基础模型 | 更新索引仍需数据管道和质量管理 |
| 可接入企业私有数据 | “接入私有数据”不自动等于隐私安全 |
| 可附带来源,提高可追溯性 | 来源存在不代表回答一定忠实于来源 |
| 减少部分事实型幻觉 | 检索失败、切分错误或上下文冲突仍会幻觉 |
5.2 RAG、微调和长上下文如何选择
| 需求 | 优先方法 |
|---|---|
| 高频更新的事实与私有文档问答 | RAG |
| 固定风格、行为模式、专业任务能力 | 微调 |
| 少量材料的一次性分析 | 直接放入长上下文 |
| 同时需要知识与稳定格式 | RAG + 提示/微调 |
5.3 Function Calling:让模型选择工具
函数调用并不是模型“亲自执行代码”。更准确的过程是:开发者向模型声明工具名称、用途和参数结构;模型根据用户意图产生结构化调用请求;宿主程序校验并执行;结果再交回模型组织回答。
用户目标 → 模型判断需要工具 → 生成参数 → 宿主校验/授权
→ 执行工具 → 返回结果 → 模型决定继续调用或给出答案
安全设计应包括:参数校验、最小权限、敏感操作确认、超时与重试、日志审计、幂等性和结果验证。
5.4 MCP:标准化模型与外部系统的连接
Anthropic 于 2024 年 11 月发布 MCP(Model Context Protocol)。它把过去各应用各自定制的数据源/工具集成,抽象为开放协议。可把 MCP 理解为 AI 应用连接外部能力的一种“通用插座”。
| 角色 | 职责 |
|---|---|
| MCP Host | 面向用户的 AI 应用,管理权限、模型和多个连接 |
| MCP Client | Host 内与某个 Server 建立协议会话的组件 |
| MCP Server | 暴露工具、资源或提示模板的服务 |
6. 多模态:从语言走向视觉、语音与视频
模态(Modality)是信息的表现形式,如文本、图像、音频、视频、传感器信号和动作。多模态模型要解决两件事:将不同模态对齐到可交互的表示空间;在模态之间理解、推理或生成。
6.1 关键技术链
| 时间 | 技术/产品 | 关键意义 |
|---|---|---|
| 2020 | ViT | 将图像切成 patch,并用 Transformer 编码视觉信息 |
| 2021 | CLIP | 用大规模图文对比学习建立开放词汇的图文语义对齐 |
| 2022 | 潜空间扩散模型 | 在压缩后的潜空间逐步去噪,降低高分辨率生成成本 |
| 2022 | DALL·E 2、Midjourney、Stable Diffusion | 文生图进入大众产品阶段 |
| 2023 | GPT-4V、Gemini | 通用模型逐步具备图像理解与跨模态推理能力 |
| 2024 起 | Sora、可灵等视频模型 | 文本/图像条件下的视频生成快速发展 |
| 2025 起 | 原生多模态生成 | 理解与生成进一步统一,图像编辑和文字渲染增强 |
6.2 CLIP 与扩散模型的关系
原稿用“CLIP 是艺术总监、扩散模型是雕塑家”帮助记忆,但技术上需要更精确:
- CLIP 的核心是图文对齐,把匹配的图像和文本拉近、不匹配的推远。
- 扩散模型学习从噪声逐步恢复数据,可用于高质量图像生成。
- 文生图系统需要文本编码器、生成网络、潜空间表示、采样器等多个组件;并非所有系统都直接使用 CLIP。
6.3 多模态仍难在哪里
- 空间关系、计数、细粒度识别可能不稳定。
- 视频中的角色一致性、长期因果和物理规律仍可能出错。
- 生成内容涉及版权、肖像权、深度伪造和数据来源问题。
- “能描述图像”不等于真正理解现实世界,也不代表可安全操控机器人。
7. 开放权重、蒸馏与垂直领域模型
7.1 开源不等于开放权重
| 开放层次 | 可能开放的内容 | 能否完整复现训练 |
|---|---|---|
| API 开放 | 模型调用接口 | 否 |
| 开放权重 | 训练后的参数文件 | 通常不能 |
| 代码开放 | 推理或训练代码 | 仍取决于数据和训练细节 |
| 高度开放 | 权重、代码、数据说明、训练配方、许可证 | 更接近可复现,但成本仍很高 |
DeepSeek-R1 于 2025 年公开模型权重与代码,并采用宽松许可证,推动了推理模型、蒸馏模型和本地部署生态。其论文报告的约 557.6 万美元数字对应 DeepSeek-V3 最终预训练运行的估算算力成本口径,不能简单等同于 R1 的全部研发、数据、硬件和人员总成本。
OpenAI 于 2025 年 8 月发布 gpt-oss-120b 和 gpt-oss-20b,属于采用 Apache 2.0 许可证的开放权重模型。把它简单写成“被 R1 迫使推出”属于因果推断,缺少可验证证据,优化版不保留这一结论。
7.2 蒸馏、量化与本地部署
| 方法 | 核心思想 | 主要收益 | 主要代价 |
|---|---|---|---|
| 知识蒸馏 | 用强模型的输出/分布训练较小模型 | 小模型继承部分能力 | 不会完整复制教师能力 |
| 量化 | 用更低位数表示权重或激活 | 降低显存和推理成本 | 可能损失精度与速度稳定性 |
| 剪枝 | 删除较不重要的参数或结构 | 缩小模型 | 需要重新评估和调优 |
| LoRA | 训练少量低秩适配参数 | 低成本定制 | 能力受基础模型上限约束 |
Ollama、llama.cpp、vLLM 等工具分别面向易用本地运行、CPU/边缘推理和高吞吐服务等场景。选择模型时要同时考虑许可证、显存、上下文长度、量化格式、语言能力、吞吐、延迟和安全维护成本。
7.3 垂直领域模型
垂直领域能力不一定需要从零训练“大模型”。更常见的工程组合是:通用基础模型 + 领域 RAG + 领域提示 + 工具 + 必要时微调 + 专家评测。
8. AI 编程:从补全到自主软件工程
8.1 三个阶段
| 阶段 | 交互方式 | AI 的工作范围 | 人的主要职责 |
|---|---|---|---|
| 代码补全 | 在编辑器中预测后续代码 | 单行、函数、局部片段 | 编写主体并审核补全 |
| AI IDE / 对话式编码 | 根据自然语言理解多个文件 | 解释、重构、生成、调试 | 提供上下文、选方案、验证 |
| Agent 式编程 | 自主探索仓库并调用终端/测试 | 规划、修改、运行、迭代 | 定义目标、权限和验收标准 |
GitHub Copilot 推动了代码补全普及;Cursor 等 AI IDE 将代码库检索、对话和多文件编辑整合进开发环境;终端型编码 Agent 则进一步进入“读取—修改—测试—修复”的闭环。
8.2 Vibe Coding 应如何理解
Vibe Coding 强调用户通过意图、试用和反馈推动代码生成,可能较少阅读底层实现。它适合原型、一次性工具和探索,但在生产系统中仍需需求澄清、架构设计、测试、代码审查、安全扫描、可观测性和维护责任。
8.3 程序员能力结构的变化
- 价值从“手写每一行”部分转移到问题定义、系统设计和验收。
- 代码阅读与判断能力更重要,因为生成速度超过人工审查速度。
- 测试、类型、静态检查、日志和自动化评测成为约束 AI 的关键反馈。
- 安全边界、依赖治理和数据隐私不能外包给模型。
9. Agent:从生成答案到执行任务
AI Agent(智能体)是围绕目标持续感知上下文、规划或选择动作、调用工具、观察结果并调整后续行为的系统。LLM 常作为其推理与决策核心,但 Agent 还需要工具、记忆、权限、状态管理和执行环境。
9.1 Agent 的基本循环
接收目标 → 获取环境状态 → 规划/选择动作 → 调用工具
↑ ↓
停止并交付 ← 判断是否完成 ← 更新记忆 ← 观察结果
ReAct 将 Reasoning 与 Acting 交替组织:模型根据当前观察决定动作,执行后读取新观察,再继续推理。它是重要范式,但现代 Agent 还可能使用显式规划器、工作流图、搜索、反思、验证器或多智能体结构。
9.2 Agent、工作流与聊天机器人的区别
| 系统 | 路径由谁决定 | 是否使用工具 | 适合任务 |
|---|---|---|---|
| 聊天机器人 | 多为单轮或简单对话逻辑 | 可选 | 问答、生成、解释 |
| 固定工作流 | 开发者预先编排 | 通常使用 | 稳定、可预测的业务流程 |
| Agent | 模型根据状态动态决定 | 通常使用多个 | 路径难预先穷举的开放任务 |
9.3 编程 Agent 的研究脉络
- ReAct(2022):把推理与外部行动结合。
- SWE-bench(2023):以真实 GitHub Issue 和仓库测试评估模型解决软件问题的能力。
- SWE-agent(2024):围绕仓库探索、编辑与测试设计 Agent—计算机接口。
- 产品化阶段:编码 Agent 开始支持长任务、并行工作、浏览器/终端操作和代码审查。
9.4 上下文工程
上下文工程(Context Engineering)是设计并维护模型在每一步真正看到的信息集合。它比“写一句漂亮提示词”更系统。
上下文可能包括:系统规则、用户目标、历史消息、检索文档、工具说明、执行结果、工作记忆、长期记忆、剩余预算和当前计划。
| 提示工程 | 上下文工程 |
|---|---|
| 关注单次输入如何表达 | 关注整个任务生命周期的信息供给 |
| 常以文本指令为中心 | 包含检索、记忆、工具结果、压缩和状态 |
| 适合单轮或短任务 | 对长任务和 Agent 更关键 |
9.5 Agent 的主要失败模式
- 错误累积:每一步 95% 正确,连续 20 步全部正确的理想概率也只有约 $0.95^{20}\approx35.8%$。
- 目标漂移:执行过程中逐渐偏离用户真实目标。
- 工具误用:选择错误工具、构造错误参数或误读返回值。
- 上下文污染:无关、过期或恶意信息进入上下文。
- 过早停止或无限循环:缺乏清晰完成条件。
- 权限风险:可写文件、发消息、付款或部署时,错误具有现实后果。
10. AGI、风险与未来判断
AGI(Artificial General Intelligence)通常指能在广泛任务与环境中学习、迁移、推理和适应的通用智能系统。但业界并无唯一公认定义或统一测量方法。
10.1 DeepMind 的二维框架
《Levels of AGI》不是简单的一条“0—5 等级尺”,而是同时考虑:
- Performance(性能深度):Emerging、Competent、Expert、Virtuoso、Superhuman。
- Generality(能力广度):Narrow AI 与 General AI。
因此,某系统可能在特定领域达到专家甚至超人水平,却仍不是通用智能。把“当前 AI 普遍处于 Level 2”当作客观定论并不严谨;必须先说明任务范围、参照人群和评测标准。
10.2 未来更值得观察的指标
- 能否在陌生任务中稳定迁移,而非依赖见过的模式。
- 能否完成数小时到数天的长任务,并保持目标与状态一致。
- 能否识别不确定性、主动验证并在证据不足时停止。
- 能否以可接受的成本、延迟和能耗持续工作。
- 能否在现实权限下满足安全、合规和责任要求。
10.3 技术进步不等于能力单向替代
未来更可能出现“模型能力 + 工具系统 + 人类组织”共同演进。模型基准分数提升,不自动转化为可靠产品;可靠产品也不只取决于模型大小,而取决于数据、交互、评测、权限、流程和责任机制。
11. 总时间线
| 时间 | 里程碑 | 认知关键词 |
|---|---|---|
| 2012 前后 | 深度学习在视觉等任务突破 | 自动表示学习 |
| 2017 | Transformer | 自注意力、并行、可扩展 |
| 2018—2020 | BERT、GPT 系列与规模化预训练 | 预训练 + 迁移 |
| 2020 | RAG、ViT | 外部知识;视觉 Transformer |
| 2021 | CLIP、GitHub Copilot | 图文对齐;AI 编程 |
| 2022 | ChatGPT、扩散模型普及、ReAct | 对话入口;生成图像;推理与行动 |
| 2023 | GPT-4V、Function Calling、SWE-bench | 多模态;工具;真实任务评测 |
| 2024 | MCP、SWE-agent、视频生成发展 | 连接标准;编码 Agent |
| 2025 起 | 推理模型、开放权重生态、Agent 产品化 | 长推理、低成本部署、自主执行 |
12. 高频术语速查
| 术语 | 一句话解释 |
|---|---|
| Token | 模型处理文本的基本单位,不一定等于一个字或一个词 |
| Parameter | 模型从训练中学习到的数值;参数量不是能力的唯一指标 |
| Context Window | 单次推理能够处理的 token 范围 |
| Fine-tuning | 在预训练模型上继续训练,以适配任务或行为 |
| Alignment | 让模型行为更符合人类意图、偏好与安全要求 |
| Hallucination | 生成看似可信但缺乏依据或错误的内容 |
| Embedding | 将对象映射为向量,以表示语义关系 |
| Reranking | 对初步检索结果进行二次排序 |
| Grounding | 让输出以给定资料、工具结果或现实状态为依据 |
| Inference | 使用训练完成的模型生成结果的过程 |
| Agent | 围绕目标持续观察、行动和修正的系统 |
| Benchmark | 用于比较系统能力的标准化任务集合 |
13. 自测题
- Transformer 相比 RNN 的核心结构优势是什么?它又带来了什么计算问题?
- 预训练、指令微调和偏好对齐分别解决什么问题?
- 为什么 ChatGPT 的突破不能只归因于模型参数量?
- RAG 能减少幻觉,为什么不能消灭幻觉?
- Function Calling 中,模型与宿主程序各自负责什么?
- MCP 标准化了什么,又没有解决什么?
- 开放权重与完整开源有什么区别?
- 为什么“垂直领域模型”不一定要从零训练?
- Agent 与固定工作流的本质区别是什么?
- 为什么单步准确率很高的 Agent 仍可能在长任务中失败?
- 上下文工程比提示工程多关注了哪些内容?
- 为什么不能直接宣布“当前 AI 已达到某个统一 AGI 等级”?
展开参考答案
- 自注意力允许 token 间直接交互,训练高度并行、扩展性强;标准注意力对长序列的计算和内存开销较大。
- 预训练学习通用模式与知识;指令微调学习任务表达和遵循指令;偏好对齐改善帮助性、安全性与风格。
- 还包括指令对齐、对话界面、产品体验、基础设施和用户反馈等系统因素。
- 检索可能漏召回、误召回,资料可能过期或冲突,模型也可能误读证据。
- 模型选择工具并产生结构化参数;宿主负责校验、授权、实际执行和返回结果。
- MCP 标准化 AI 应用与工具/数据源的连接方式;不自动保证工具质量、模型判断或权限安全。
- 开放权重只是公开训练后参数;完整复现还需要训练代码、数据、配方和大量算力。
- 可组合通用模型、RAG、工具、提示和轻量微调,以更低成本获得领域能力。
- 固定工作流路径由开发者预设;Agent 根据目标和环境动态选择下一步。
- 多步成功率会相乘,任何一步的错误还可能污染后续状态。
- 它还管理检索、记忆、工具结果、状态、压缩、权限和生命周期中的信息流。
- AGI 没有单一定义;能力还分广度与深度,结论取决于任务、参照对象和评测方法。
14. 延伸阅读
- Vaswani et al., Attention Is All You Need(2017)
- Brown et al., Language Models are Few-Shot Learners(2020)
- Lewis et al., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks(2020)
- Dosovitskiy et al., An Image is Worth 16×16 Words(2020)
- Radford et al., Learning Transferable Visual Models From Natural Language Supervision(2021)
- Wei et al., Emergent Abilities of Large Language Models(2022)
- Yao et al., ReAct: Synergizing Reasoning and Acting in Language Models(2022)
- Rombach et al., High-Resolution Image Synthesis with Latent Diffusion Models(2022)
- Jimenez et al., SWE-bench(2023)
- Morris et al., Levels of AGI: Operationalizing Progress on the Path to AGI(2023)
- Yang et al., SWE-agent(2024)
- DeepSeek-AI, DeepSeek-R1(2025)