← Frontend / AI

AI技术的演进和发展

AI 技术的发展历程、关键阶段与未来趋势

学习目标:建立一条“算法架构 → 基础模型 → 外部知识与工具 → 多模态 → 开放生态 → AI 编程 → Agent → AGI”的完整认知链,理解每次技术跃迁解决了什么问题,又引入了什么新限制。

目录

  1. 总览:AI 演进的核心逻辑
  2. 2017 年以前:专用 AI 与深度学习崛起
  3. 2017—2023:Transformer、基础模型与对话式 AI
  4. 提示工程:用输入控制模型行为
  5. 2020—至今:RAG、工具调用与 MCP
  6. 多模态:从语言走向视觉、语音与视频
  7. 开放权重、蒸馏与垂直领域模型
  8. AI 编程:从补全到自主软件工程
  9. Agent:从生成答案到执行任务
  10. AGI、风险与未来判断
  11. 总时间线、术语速查、自测题与答案

1. 总览:AI 演进的核心逻辑

AI 的发展不只是“模型越来越大”,而是不断补齐智能系统的能力闭环:


感知输入 → 表示与理解 → 推理与规划 → 调用知识/工具 → 执行动作 → 获取反馈 → 修正策略

阶段 核心突破 主要解决的问题 新暴露的问题
专用 AI 机器学习、深度学习 从数据中学习单一任务 泛化弱、开发门槛高
Transformer 自注意力、并行训练 长距离依赖和训练效率 数据与算力需求巨大
大语言模型 预训练、规模化、指令对齐 一个模型处理多类语言任务 幻觉、知识截止、不可控
RAG / 工具调用 外部检索与函数接口 接入私有知识和真实能力 检索质量、工具安全、工程复杂度
多模态 跨模态表示与生成 理解和生成图文音视频 一致性、物理规律、版权与伪造
Agent 规划、记忆、工具、反馈循环 持续完成多步骤任务 错误累积、成本、权限与可靠性

一句话主线:AI 从“为一个任务训练一个模型”,逐步走向“以基础模型为认知核心,连接知识、工具和环境,自主完成目标”。


2. 2017 年以前:专用 AI 与深度学习崛起

2.1 基础概念

概念 定义 关系或例子
AI(Artificial Intelligence) 让机器表现出感知、理解、推理、决策、学习或生成能力的总称 最大的概念集合
ML(Machine Learning) 让系统从数据中学习规律,而非完全依靠人工规则 AI 的主要实现路径之一
DL(Deep Learning) 使用多层神经网络学习复杂表示 ML 的子集
NLP 处理、理解和生成人类语言 翻译、分类、问答、摘要
CV 从图像或视频中提取语义 分类、检测、分割、OCR
ASR Automatic Speech Recognition,语音转文字 与语音合成 TTS 方向相反
RL 智能体通过状态、动作和奖励信号学习策略 游戏、机器人控制、模型后训练

表示学习是深度学习成功的关键:模型不再完全依赖人类手工设计特征,而是从原始数据中自动学习有用的内部表示。

2.2 传统方法到深度学习

传统机器学习常见流程是:人工提取特征 → 选择算法 → 训练分类器。比如垃圾邮件识别会人为统计关键词、词频和发送者特征。深度学习则把“特征提取”和“任务学习”放进同一个神经网络中联合优化。

维度 传统机器学习 深度学习
特征 依赖人工设计 自动学习多层表示
数据规模 中小规模也可工作 通常更依赖大量数据
算力需求 相对较低 GPU/TPU 等并行算力需求高
可解释性 部分算法较强 通常较弱
典型模型 决策树、SVM、逻辑回归 CNN、RNN、Transformer

2.3 为什么早期 AI 多为“专才”

  1. 任务定义狭窄:情感分类、机器翻译和图像识别通常分别训练。
  2. 数据彼此割裂:标注数据昂贵,不同任务的数据格式也不同。
  3. 模型迁移能力有限:在一个数据集上学到的能力难以直接用于另一任务。
  4. 交互方式工程化:用户面对的是按钮、接口和规则,而不是通用自然语言入口。
易错点:2017 年以前并非“没有通用研究”或“AI 完全不能处理复杂任务”。更准确的说法是:产业主流仍以任务专用模型为主,跨任务迁移和自然语言交互能力远弱于今天。

3. 2017—2023:Transformer、基础模型与对话式 AI

3.1 Transformer 解决了什么

2017 年论文《Attention Is All You Need》提出 Transformer。它是一种神经网络架构,不是某个具体产品或单一模型。

此前 NLP 常使用 RNN/LSTM:信息按词序逐步传递,天然适合序列,但训练难以充分并行,长距离信息也可能衰减。Transformer 主要依靠自注意力,让每个 token 根据任务需要聚合序列中其他 token 的信息。

自注意力可简化表示为:

$$

\operatorname{Attention}(Q,K,V)=\operatorname{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V

$$

  • Query(Q):当前 token 想寻找什么信息。
  • Key(K):每个 token 可供匹配的索引。
  • Value(V):匹配后真正聚合的内容。
  • 多头注意力:让不同注意力头同时学习语法、指代、位置或语义等关系。
对比维度 RNN/LSTM Transformer
计算方式 顺序递归 训练阶段高度并行
长距离依赖 信息需多步传递 token 间可直接建立注意力关系
扩展性 大规模训练受限 更适合扩大参数、数据与算力
主要代价 长序列记忆困难 标准注意力计算量随序列长度近似平方增长
记忆技巧:Transformer 的历史意义可记为“看得全、算得并、扩得大”。这是一种直观概括,不代表它没有上下文窗口和计算复杂度限制。

3.2 从语言模型到大型语言模型

语言模型的基本任务是根据已有 token 预测后续 token,或恢复被遮盖的 token。通过在海量文本上进行自监督预训练,模型会压缩语言规律、事实关联、写作模式以及一定的推理模式。

LLM 的能力通常来自三层训练:

  1. 预训练(Pre-training):学习通用语言和世界知识,成本最高。
  2. 监督式指令微调(SFT):用“指令—理想回答”数据教模型遵循任务。
  3. 偏好对齐:使用 RLHF、RLAIF 或直接偏好优化等方法,使回答更有帮助、更安全、更符合人类偏好。

训练大模型的关键要素:架构、数据、算力、训练算法、评测与工程系统。原稿中的“架构 + 数据 + 算力”是重要概括,但并不完整。

3.3 ChatGPT 为什么成为转折点

2022 年 11 月发布的 ChatGPT 并不是第一个语言模型,也不是第一个聊天机器人。它的突破在于把较强的基础模型、指令对齐、对话界面和低门槛产品体验组合起来,让普通用户能用自然语言直接调用模型能力。

层次 作用
基础模型 提供语言、知识、生成和一定推理能力
指令微调 理解“总结、比较、改写、写代码”等任务形式
人类反馈对齐 改善帮助性、安全性和对话风格
对话产品 保存上下文、降低使用门槛、形成反馈循环

3.4 涌现能力:应谨慎理解

所谓涌现能力(Emergent Abilities),是指某些任务表现在规模扩大后出现明显跃升,例如少样本学习、代码生成或复杂推理。但“突然出现”有时也与评测指标不连续、提示方式或任务难度有关。

常见能力包括:

  • 上下文学习(In-context Learning):仅靠当前上下文里的说明和示例完成新任务,不等于更新模型参数。
  • 零样本/少样本学习:没有示例或只有少量示例时执行任务。
  • 代码生成与工具选择:生成程序或结构化工具参数。
  • 复杂推理:在数学、逻辑和规划任务中生成中间步骤,但步骤可能貌似合理而实际错误。
易错点:Chain-of-Thought 是一种产生中间推理文本的方法,不保证推理忠实,也不等于模型拥有与人类相同的思维过程。

4. 提示工程:用输入控制模型行为

提示工程(Prompt Engineering)是设计模型输入,以提高输出质量、稳定性和可控性的方法。它不修改模型参数,属于推理阶段控制。

4.1 一个实用提示结构


角色/背景:你在什么情境中工作

目标:最终要产出什么

输入:模型需要处理的材料

约束:范围、格式、语气、禁止事项

评判标准:什么算高质量

示例:必要时给一到三个输入输出示范

4.2 常见策略

策略 适用场景 注意事项
明确任务与边界 几乎所有任务 避免“帮我优化一下”这类模糊目标
提供参考材料 总结、抽取、问答 要求模型区分材料事实与外部推断
Few-shot 示例 固定风格、分类、结构化抽取 示例质量比数量更重要
结构化输出 需要程序继续处理 使用 JSON Schema 或固定表格字段
拆分复杂任务 研究、规划、长文写作 每一步设置验收条件
自检/评审 高要求产出 不能替代外部验证和人工审核
限制:“Let’s think step by step”曾是经典技巧,但现代推理模型不一定需要这句话。提示技巧高度依赖模型、任务与评测,不能当作普适魔法。

5. 2020—至今:RAG、工具调用与 MCP

LLM 有两类结构性短板:模型参数中的知识可能过时或缺失;仅生成文本无法直接查询数据库、发送请求或操作软件。RAG 主要补“知识”,工具调用主要补“行动”。

5.1 RAG:把外部知识放进当前上下文

RAG(Retrieval-Augmented Generation)是在生成前检索相关资料,并把结果提供给模型作为回答依据。

典型流程:


文档采集 → 清洗与切分 → Embedding 向量化 → 建立索引

用户问题 → 查询改写 → 召回候选 → 重排 → 拼接上下文 → LLM 生成 → 引用/评估

Embedding 把文本映射为向量,使语义相近的内容在向量空间中更接近。实际系统常结合向量检索与关键词检索,再使用重排模型提高相关性。

RAG 优势 对应限制
知识更新不必重新训练基础模型 更新索引仍需数据管道和质量管理
可接入企业私有数据 “接入私有数据”不自动等于隐私安全
可附带来源,提高可追溯性 来源存在不代表回答一定忠实于来源
减少部分事实型幻觉 检索失败、切分错误或上下文冲突仍会幻觉

5.2 RAG、微调和长上下文如何选择

需求 优先方法
高频更新的事实与私有文档问答 RAG
固定风格、行为模式、专业任务能力 微调
少量材料的一次性分析 直接放入长上下文
同时需要知识与稳定格式 RAG + 提示/微调

5.3 Function Calling:让模型选择工具

函数调用并不是模型“亲自执行代码”。更准确的过程是:开发者向模型声明工具名称、用途和参数结构;模型根据用户意图产生结构化调用请求;宿主程序校验并执行;结果再交回模型组织回答。


用户目标 → 模型判断需要工具 → 生成参数 → 宿主校验/授权

→ 执行工具 → 返回结果 → 模型决定继续调用或给出答案

安全设计应包括:参数校验、最小权限、敏感操作确认、超时与重试、日志审计、幂等性和结果验证。

5.4 MCP:标准化模型与外部系统的连接

Anthropic 于 2024 年 11 月发布 MCP(Model Context Protocol)。它把过去各应用各自定制的数据源/工具集成,抽象为开放协议。可把 MCP 理解为 AI 应用连接外部能力的一种“通用插座”。

角色 职责
MCP Host 面向用户的 AI 应用,管理权限、模型和多个连接
MCP Client Host 内与某个 Server 建立协议会话的组件
MCP Server 暴露工具、资源或提示模板的服务
易错点:MCP 不会自动让模型变聪明,也不会自动保证安全。它标准化“如何连接”,但工具是否可信、权限是否合理、调用是否正确仍由系统设计负责。

6. 多模态:从语言走向视觉、语音与视频

模态(Modality)是信息的表现形式,如文本、图像、音频、视频、传感器信号和动作。多模态模型要解决两件事:将不同模态对齐到可交互的表示空间;在模态之间理解、推理或生成。

6.1 关键技术链

时间 技术/产品 关键意义
2020 ViT 将图像切成 patch,并用 Transformer 编码视觉信息
2021 CLIP 用大规模图文对比学习建立开放词汇的图文语义对齐
2022 潜空间扩散模型 在压缩后的潜空间逐步去噪,降低高分辨率生成成本
2022 DALL·E 2、Midjourney、Stable Diffusion 文生图进入大众产品阶段
2023 GPT-4V、Gemini 通用模型逐步具备图像理解与跨模态推理能力
2024 起 Sora、可灵等视频模型 文本/图像条件下的视频生成快速发展
2025 起 原生多模态生成 理解与生成进一步统一,图像编辑和文字渲染增强

6.2 CLIP 与扩散模型的关系

原稿用“CLIP 是艺术总监、扩散模型是雕塑家”帮助记忆,但技术上需要更精确:

  • CLIP 的核心是图文对齐,把匹配的图像和文本拉近、不匹配的推远。
  • 扩散模型学习从噪声逐步恢复数据,可用于高质量图像生成。
  • 文生图系统需要文本编码器、生成网络、潜空间表示、采样器等多个组件;并非所有系统都直接使用 CLIP。

6.3 多模态仍难在哪里

  • 空间关系、计数、细粒度识别可能不稳定。
  • 视频中的角色一致性、长期因果和物理规律仍可能出错。
  • 生成内容涉及版权、肖像权、深度伪造和数据来源问题。
  • “能描述图像”不等于真正理解现实世界,也不代表可安全操控机器人。

7. 开放权重、蒸馏与垂直领域模型

7.1 开源不等于开放权重

开放层次 可能开放的内容 能否完整复现训练
API 开放 模型调用接口 否
开放权重 训练后的参数文件 通常不能
代码开放 推理或训练代码 仍取决于数据和训练细节
高度开放 权重、代码、数据说明、训练配方、许可证 更接近可复现,但成本仍很高

DeepSeek-R1 于 2025 年公开模型权重与代码,并采用宽松许可证,推动了推理模型、蒸馏模型和本地部署生态。其论文报告的约 557.6 万美元数字对应 DeepSeek-V3 最终预训练运行的估算算力成本口径,不能简单等同于 R1 的全部研发、数据、硬件和人员总成本。

OpenAI 于 2025 年 8 月发布 gpt-oss-120b 和 gpt-oss-20b,属于采用 Apache 2.0 许可证的开放权重模型。把它简单写成“被 R1 迫使推出”属于因果推断,缺少可验证证据,优化版不保留这一结论。

7.2 蒸馏、量化与本地部署

方法 核心思想 主要收益 主要代价
知识蒸馏 用强模型的输出/分布训练较小模型 小模型继承部分能力 不会完整复制教师能力
量化 用更低位数表示权重或激活 降低显存和推理成本 可能损失精度与速度稳定性
剪枝 删除较不重要的参数或结构 缩小模型 需要重新评估和调优
LoRA 训练少量低秩适配参数 低成本定制 能力受基础模型上限约束

Ollama、llama.cpp、vLLM 等工具分别面向易用本地运行、CPU/边缘推理和高吞吐服务等场景。选择模型时要同时考虑许可证、显存、上下文长度、量化格式、语言能力、吞吐、延迟和安全维护成本。

7.3 垂直领域模型

垂直领域能力不一定需要从零训练“大模型”。更常见的工程组合是:通用基础模型 + 领域 RAG + 领域提示 + 工具 + 必要时微调 + 专家评测。

高风险提醒:医疗、法律、金融场景必须建立数据治理、专业复核、审计和责任边界。模型语言流畅不等于专业结论可靠。

8. AI 编程:从补全到自主软件工程

8.1 三个阶段

阶段 交互方式 AI 的工作范围 人的主要职责
代码补全 在编辑器中预测后续代码 单行、函数、局部片段 编写主体并审核补全
AI IDE / 对话式编码 根据自然语言理解多个文件 解释、重构、生成、调试 提供上下文、选方案、验证
Agent 式编程 自主探索仓库并调用终端/测试 规划、修改、运行、迭代 定义目标、权限和验收标准

GitHub Copilot 推动了代码补全普及;Cursor 等 AI IDE 将代码库检索、对话和多文件编辑整合进开发环境;终端型编码 Agent 则进一步进入“读取—修改—测试—修复”的闭环。

8.2 Vibe Coding 应如何理解

Vibe Coding 强调用户通过意图、试用和反馈推动代码生成,可能较少阅读底层实现。它适合原型、一次性工具和探索,但在生产系统中仍需需求澄清、架构设计、测试、代码审查、安全扫描、可观测性和维护责任。

8.3 程序员能力结构的变化

  • 价值从“手写每一行”部分转移到问题定义、系统设计和验收。
  • 代码阅读与判断能力更重要,因为生成速度超过人工审查速度。
  • 测试、类型、静态检查、日志和自动化评测成为约束 AI 的关键反馈。
  • 安全边界、依赖治理和数据隐私不能外包给模型。
纠偏:“基础前端会被完全取代”或“某家公司垄断 AI 编程”都属于过度确定的判断。更可靠的结论是:重复性实现被显著压缩,岗位任务组合和能力门槛正在变化。

9. Agent:从生成答案到执行任务

AI Agent(智能体)是围绕目标持续感知上下文、规划或选择动作、调用工具、观察结果并调整后续行为的系统。LLM 常作为其推理与决策核心,但 Agent 还需要工具、记忆、权限、状态管理和执行环境。

9.1 Agent 的基本循环


接收目标 → 获取环境状态 → 规划/选择动作 → 调用工具

↑ ↓

停止并交付 ← 判断是否完成 ← 更新记忆 ← 观察结果

ReAct 将 Reasoning 与 Acting 交替组织:模型根据当前观察决定动作,执行后读取新观察,再继续推理。它是重要范式,但现代 Agent 还可能使用显式规划器、工作流图、搜索、反思、验证器或多智能体结构。

9.2 Agent、工作流与聊天机器人的区别

系统 路径由谁决定 是否使用工具 适合任务
聊天机器人 多为单轮或简单对话逻辑 可选 问答、生成、解释
固定工作流 开发者预先编排 通常使用 稳定、可预测的业务流程
Agent 模型根据状态动态决定 通常使用多个 路径难预先穷举的开放任务

9.3 编程 Agent 的研究脉络

  • ReAct(2022):把推理与外部行动结合。
  • SWE-bench(2023):以真实 GitHub Issue 和仓库测试评估模型解决软件问题的能力。
  • SWE-agent(2024):围绕仓库探索、编辑与测试设计 Agent—计算机接口。
  • 产品化阶段:编码 Agent 开始支持长任务、并行工作、浏览器/终端操作和代码审查。

9.4 上下文工程

上下文工程(Context Engineering)是设计并维护模型在每一步真正看到的信息集合。它比“写一句漂亮提示词”更系统。

上下文可能包括:系统规则、用户目标、历史消息、检索文档、工具说明、执行结果、工作记忆、长期记忆、剩余预算和当前计划。

提示工程 上下文工程
关注单次输入如何表达 关注整个任务生命周期的信息供给
常以文本指令为中心 包含检索、记忆、工具结果、压缩和状态
适合单轮或短任务 对长任务和 Agent 更关键

9.5 Agent 的主要失败模式

  1. 错误累积:每一步 95% 正确,连续 20 步全部正确的理想概率也只有约 $0.95^{20}\approx35.8%$。
  2. 目标漂移:执行过程中逐渐偏离用户真实目标。
  3. 工具误用:选择错误工具、构造错误参数或误读返回值。
  4. 上下文污染:无关、过期或恶意信息进入上下文。
  5. 过早停止或无限循环:缺乏清晰完成条件。
  6. 权限风险:可写文件、发消息、付款或部署时,错误具有现实后果。
设计原则:高可靠 Agent 不是“给模型更多自由”,而是给它清晰目标、合适工具、最小权限、可观测反馈、确定性检查和必要的人类确认。

10. AGI、风险与未来判断

AGI(Artificial General Intelligence)通常指能在广泛任务与环境中学习、迁移、推理和适应的通用智能系统。但业界并无唯一公认定义或统一测量方法。

10.1 DeepMind 的二维框架

《Levels of AGI》不是简单的一条“0—5 等级尺”,而是同时考虑:

  • Performance(性能深度):Emerging、Competent、Expert、Virtuoso、Superhuman。
  • Generality(能力广度):Narrow AI 与 General AI。

因此,某系统可能在特定领域达到专家甚至超人水平,却仍不是通用智能。把“当前 AI 普遍处于 Level 2”当作客观定论并不严谨;必须先说明任务范围、参照人群和评测标准。

10.2 未来更值得观察的指标

  • 能否在陌生任务中稳定迁移,而非依赖见过的模式。
  • 能否完成数小时到数天的长任务,并保持目标与状态一致。
  • 能否识别不确定性、主动验证并在证据不足时停止。
  • 能否以可接受的成本、延迟和能耗持续工作。
  • 能否在现实权限下满足安全、合规和责任要求。

10.3 技术进步不等于能力单向替代

未来更可能出现“模型能力 + 工具系统 + 人类组织”共同演进。模型基准分数提升,不自动转化为可靠产品;可靠产品也不只取决于模型大小,而取决于数据、交互、评测、权限、流程和责任机制。


11. 总时间线

时间 里程碑 认知关键词
2012 前后 深度学习在视觉等任务突破 自动表示学习
2017 Transformer 自注意力、并行、可扩展
2018—2020 BERT、GPT 系列与规模化预训练 预训练 + 迁移
2020 RAG、ViT 外部知识;视觉 Transformer
2021 CLIP、GitHub Copilot 图文对齐;AI 编程
2022 ChatGPT、扩散模型普及、ReAct 对话入口;生成图像;推理与行动
2023 GPT-4V、Function Calling、SWE-bench 多模态;工具;真实任务评测
2024 MCP、SWE-agent、视频生成发展 连接标准;编码 Agent
2025 起 推理模型、开放权重生态、Agent 产品化 长推理、低成本部署、自主执行

12. 高频术语速查

术语 一句话解释
Token 模型处理文本的基本单位,不一定等于一个字或一个词
Parameter 模型从训练中学习到的数值;参数量不是能力的唯一指标
Context Window 单次推理能够处理的 token 范围
Fine-tuning 在预训练模型上继续训练,以适配任务或行为
Alignment 让模型行为更符合人类意图、偏好与安全要求
Hallucination 生成看似可信但缺乏依据或错误的内容
Embedding 将对象映射为向量,以表示语义关系
Reranking 对初步检索结果进行二次排序
Grounding 让输出以给定资料、工具结果或现实状态为依据
Inference 使用训练完成的模型生成结果的过程
Agent 围绕目标持续观察、行动和修正的系统
Benchmark 用于比较系统能力的标准化任务集合

13. 自测题

  1. Transformer 相比 RNN 的核心结构优势是什么?它又带来了什么计算问题?
  2. 预训练、指令微调和偏好对齐分别解决什么问题?
  3. 为什么 ChatGPT 的突破不能只归因于模型参数量?
  4. RAG 能减少幻觉,为什么不能消灭幻觉?
  5. Function Calling 中,模型与宿主程序各自负责什么?
  6. MCP 标准化了什么,又没有解决什么?
  7. 开放权重与完整开源有什么区别?
  8. 为什么“垂直领域模型”不一定要从零训练?
  9. Agent 与固定工作流的本质区别是什么?
  10. 为什么单步准确率很高的 Agent 仍可能在长任务中失败?
  11. 上下文工程比提示工程多关注了哪些内容?
  12. 为什么不能直接宣布“当前 AI 已达到某个统一 AGI 等级”?
展开参考答案
  1. 自注意力允许 token 间直接交互,训练高度并行、扩展性强;标准注意力对长序列的计算和内存开销较大。
  2. 预训练学习通用模式与知识;指令微调学习任务表达和遵循指令;偏好对齐改善帮助性、安全性与风格。
  3. 还包括指令对齐、对话界面、产品体验、基础设施和用户反馈等系统因素。
  4. 检索可能漏召回、误召回,资料可能过期或冲突,模型也可能误读证据。
  5. 模型选择工具并产生结构化参数;宿主负责校验、授权、实际执行和返回结果。
  6. MCP 标准化 AI 应用与工具/数据源的连接方式;不自动保证工具质量、模型判断或权限安全。
  7. 开放权重只是公开训练后参数;完整复现还需要训练代码、数据、配方和大量算力。
  8. 可组合通用模型、RAG、工具、提示和轻量微调,以更低成本获得领域能力。
  9. 固定工作流路径由开发者预设;Agent 根据目标和环境动态选择下一步。
  10. 多步成功率会相乘,任何一步的错误还可能污染后续状态。
  11. 它还管理检索、记忆、工具结果、状态、压缩、权限和生命周期中的信息流。
  12. AGI 没有单一定义;能力还分广度与深度,结论取决于任务、参照对象和评测方法。

14. 延伸阅读

  • Vaswani et al., Attention Is All You Need(2017)
  • Brown et al., Language Models are Few-Shot Learners(2020)
  • Lewis et al., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks(2020)
  • Dosovitskiy et al., An Image is Worth 16×16 Words(2020)
  • Radford et al., Learning Transferable Visual Models From Natural Language Supervision(2021)
  • Wei et al., Emergent Abilities of Large Language Models(2022)
  • Yao et al., ReAct: Synergizing Reasoning and Acting in Language Models(2022)
  • Rombach et al., High-Resolution Image Synthesis with Latent Diffusion Models(2022)
  • Jimenez et al., SWE-bench(2023)
  • Morris et al., Levels of AGI: Operationalizing Progress on the Path to AGI(2023)
  • Yang et al., SWE-agent(2024)
  • DeepSeek-AI, DeepSeek-R1(2025)

关键官方资料链接