一口气搞懂 45 个 AI 术语:从 LLM 到 Ontology

阅读量6101

发布时间 : 2026-09-21 15:52:09

读一篇 AI 文章,最劝退的往往不是结论,而是名词。

大模型、智能体、MCP、A2A、Token、RAG、蒸馏、微调……这些词摆在正文里,像一道门槛。你大概知道它们各自是干什么的,但要你解释给别人听,又觉得说不清楚。

这篇不打算讲什么新东西,只做一件事:把 AI 行业高频出现的 44 个术语,一个个说清楚它们指什么、不指什么、和旁边那个词差在哪。

按十个小节排好,遇到不确定的词,直接翻到对应条目就行。


一、AI 的”大脑”

1. 大模型(LLM,Large Language Model)

大模型指参数量在十亿级以上、用海量文本训练出来的人工神经网络,核心任务是根据已有上下文预测下一个词。正因为”预测下一个词”这件事被做到了很高的准确度,它才表现出对话、写作、编程、推理这些能力。

它和”普通 AI 模型”的差别不在算法血统,而在规模。同样的架构,参数和数据放大到某个量级之后,能力会出现跃升,这也是这类模型被称为”大”的原因。

按处理的输入类型,常见分类有:大语言模型(文本)、视觉大模型(图像)、多模态大模型(文本加图像加音频等混合)、面向科研的科学大模型。

有一点需要先记住:大模型的知识截止于训练数据的时间点,它本身不会主动更新,也不会天然知道你的内部资料。后面讲的 RAG 和微调,都是在这个前提下补短板的手段。

一句话:参数量、训练数据规模远高于传统模型,并因此获得通用能力的模型,叫大模型。

2. Transformer

Transformer 是 2017 年 Google 团队在论文《Attention Is All You Need》中提出的网络架构,用自注意力机制取代了此前处理序列数据主流的 RNN 和 CNN。

RNN 处理一句话是从左到右逐个词推进,越往后的词,对前面信息的记忆越弱。自注意力的做法不同:序列中任意两个位置可以直接建立关联,不受距离影响。这既解决了长距离依赖,也让计算可以大规模并行,而并行能力是训练规模能继续放大的前提。

很多文章把 Transformer 概括成”编码器加解码器”,这只是原始论文的形态。此后分化出三条路线:只用编码器的(BERT 一类,擅长理解)、只用解码器的(GPT、Claude、DeepSeek 一类,擅长生成)、两者都用的(最初的机器翻译形态)。今天说”大模型”,绝大多数指的是解码器这一支。

一句话:Transformer 靠自注意力一次性建模序列中所有位置的关系,是当前主流大模型的共同底座。

3. BERT

BERT 是 Google 在 2018 年发布的模型,全称 Bidirectional Encoder Representations from Transformers,取 Transformer 的编码器部分,训练目标是”把句子里被遮住的词补回来”,因此学到的是双向的语义表示。

它只做理解,不做生成。搜索、文本分类、情感分析、意图识别这类”给定一段文本、输出一个判断”的任务是它的主场。Google 搜索在 2019 年引入 BERT,用来理解长尾查询背后真正想问的东西。

一句话:BERT 是只做理解、不做生成的一类模型,凡是要”读懂”而不是”写出”的场景,都可能用到它。

4. AGI(Artificial General Intelligence,通用人工智能)

AGI 指具备跨领域通用能力、能像人一样学习并解决未见过问题的 AI。当前所有系统都是窄 AI:能力边界由训练目标决定,下棋的不会写代码。

真正的争议在判断标准。”能通过图灵测试””能在多数经济性工作上超过人类””能自主设定目标”——不同定义给出的时间表能差几十年。所以当有人断言”AGI 还有三年”时,先问他用的是哪个定义,通常比争论本身更有意义。

一句话:AGI 是能力不限于特定任务的 AI,目前不存在,连”怎样才算达到”都没有统一标准。

5. AIGC(AI Generated Content)

AIGC 指由 AI 生成的内容,与 PGC(专业生产内容)、UGC(用户生产内容)并列,区别只在生产者是谁。

边界值得划清楚:AI 辅助润色、生成初稿、批量出图,产出的是 AIGC;人类主导、AI 只当工具的部分,仍算人类创作。这个区分在版权认定和平台标注要求上,正在变成实打实的规则问题。

一句话:内容的生产者里有 AI,就叫 AIGC。


二、人怎么跟 AI 打交道

6. Prompt(提示词)

Prompt 是你交给模型的输入,包括指令、背景、示例、约束条件。

同一个模型,输出质量差别很大,多数时候差别来自 Prompt 里有没有把任务说清楚:要什么、不要什么、按什么格式、给谁看。这不是玄学——模型只能依据你给出的信息作答,信息缺失的部分,它会用统计上最可能的答案去填。

Prompt Engineering 这门手艺,本质是把脑子里的隐含要求显式写出来。

一句话:Prompt 是模型的全部已知条件,写得越具体,模型自由发挥的空间越受约束。

7. Context(上下文)

Context 指模型在当前这一次调用中能看到的全部内容——系统指令、历史对话、检索到的资料、你刚输入的问题。它决定模型”此刻记得什么”。

关键在两点。第一,超出上下文窗口的内容对模型等于不存在,不会自动保留到下一轮。第二,窗口大不等于记得牢:内容越长,模型对中间部分的关注越弱,这在业界被称为”lost in the middle”。所以长对话里可靠的做法,是把关键信息放在开头或结尾,而不是指望它全记住。

一句话:Context 是模型的短期记忆,容量有限,而且不是每个位置都被同等对待。

8. Token(词元)

Token 是模型处理文本的最小单位。分词器把文本切成 Token,模型读的是 Token 序列,计费也按 Token 数量算。

一个 Token 不等于一个字或一个词。英文里常见词往往是 1 个 Token,长词会被切成多个;中文在不同分词器下的切分差别很大,通常一个汉字接近 1 个 Token,生僻字或多字词可能占 2 个以上。准确的换算只能以具体模型的分词器为准,网上的”通用换算表”仅供参考。

知道 Token 有什么实际用处?一是估算成本,输入和输出分开计价,长文档问答的成本大头常在输入;二是判断上下文放不放得下,一份二十页的 PDF 转成文本后大致占多少 Token,心里要有数。

一句话:Token 是模型的计量单位,成本、速度、上下文容量都以它衡量。

9. CLI(Command Line Interface,命令行界面)

CLI 是通过键盘输入命令来操作程序的界面,与图形界面(GUI)相对。

AI 圈频繁提 CLI,是因为多数编程智能体都以命令行形态提供:在终端执行 claude、codex 这类命令启动,它就能直接读写当前目录的文件、运行命令、跑测试。相比 IDE 插件,CLI 的优势是轻、可脚本化、能嵌进 CI/CD 流水线。

一句话:CLI 是用命令而非鼠标操作程序的界面,也是目前编程智能体最主要的入口形态。


三、AI 怎么变得更能用

10. RAG(Retrieval-Augmented Generation,检索增强生成)

RAG 是在模型回答之前,先从外部资料库检索相关内容,把检索结果作为上下文一起交给模型的做法。

它解决大模型的两个硬伤:知识过期、不知道你的私有资料。相比把知识”训进”模型的微调,RAG 的改动发生在推理时,资料更新只需更新索引,出问题也容易定位到是哪段检索结果带偏了答案。

企业做智能客服、内部知识问答,绝大多数走的是这条路。工程上的难点通常不在模型,而在检索质量:切块策略、召回率、重排,以及前面提到的术语归一问题。

一句话:RAG 让模型先查资料再回答,把”记住”的负担从模型转到可随时更新的资料库。

11. Embedding(向量嵌入)

Embedding 把文本、图片这类内容映射成一串固定长度的数字(向量),使语义相近的内容在向量空间里距离也相近。

它是”按意思找东西”的底层能力。传统搜索靠关键词匹配,你说”怎么退订”,文档里写的是”取消订阅”,字面对不上就搜不到;Embedding 能把这两句话算得很近,因此成为语义检索、推荐、去重、聚类的基础组件。

需要留意:向量相似度衡量的是整体语义接近,不理解否定和因果。”可以退款”和”不能退款”的向量距离往往很近,这正是纯向量检索容易出错的地方,实际系统通常用关键词检索和向量检索混合来补。

一句话:Embedding 把内容变成可计算的向量,让机器能判断两段内容像不像。

12. 蒸馏(Knowledge Distillation)

蒸馏是把大模型(教师)的能力迁移到小模型(学生)上的训练方法。学生模型不只学标准答案,还要模仿教师输出的概率分布——也就是”教师认为哪些错误答案次优”,这些信息比一个正确答案更有指导性。

它解决的是部署问题:大模型效果好,但推理成本高、延迟大,很多场景(手机端、高并发接口)用不起。蒸馏后的小模型在目标任务上接近大模型表现,成本却低一个量级。

也要知道边界:蒸馏保留的是教师模型在训练分布上的能力,超出这个范围,小模型的泛化明显更弱。

一句话:蒸馏是用大模型教小模型,把能力压缩到能落地的体积和成本上。

13. 微调(Fine-tuning)

微调是在已经预训练好的模型上,用特定领域或特定任务的数据继续训练,让输出更贴合该场景。

它常被拿来和 RAG 比较,但解决的其实不是同一件事:RAG 补的是”模型不知道的事实”,微调改的是”模型的表达方式和行为习惯”——比如稳定输出固定字段结构、遵循某种话术风格、理解行业内的特殊表述。想让模型记住频繁变动的业务数据,应该用 RAG;想让模型稳定地按某种格式和口径说话,才轮到微调。

成本上,全量微调需要可观的算力和数据量;参数高效微调(LoRA 等方法)只训练少量附加参数,门槛低得多,是目前的主流做法。

一句话:微调是让模型改行为,不是让它背知识。

14. 对齐(Alignment)

对齐指通过训练手段,让模型的行为符合人类的意图和价值准则。

预训练完的模型只会”续写最可能的内容”,不会判断什么该说什么不该说。对齐要解决三类问题:有用(真的帮上忙)、诚实(不知道就说不知道,不编造)、无害(不输出危险内容和有害建议)。

常用手段是 RLHF(基于人类反馈的强化学习)和 DPO(直接偏好优化)。前者先让人对模型的多个回答排序,训练一个打分模型,再用它指导模型优化;后者直接用偏好数据优化模型,省掉了单独训练奖励模型这一步。

一句话:对齐是在模型能力之上加一层行为约束,让它有用、诚实、不闯祸。

15. MoE(Mixture of Experts,混合专家模型)

MoE 是一种模型结构:把前馈层拆成若干”专家”子网络,每次前向计算只激活与当前输入最相关的少数几个,由路由网络决定激活谁。

它的价值在于把”参数量”和”计算量”解耦。一个总参数六千亿的 MoE 模型,单个 Token 实际只用到其中几百亿参数,因此能达到大模型的表达能力,同时把推理成本压在远低于同规模稠密模型的水平。据多方披露,GPT-4 和 DeepSeek 系列都采用了这一结构。

代价也有:所有专家都要载入显存,对显存容量要求高;路由均衡是训练难点,处理不好会出现少数专家被反复使用、其余专家训练不充分的情况。

一句话:MoE 用”按需激活”换取大参数量与低计算量,是目前主流大模型普遍采用的结构。


四、神经网络的几个基础概念

16. BP(Backpropagation,反向传播)

BP 是训练神经网络的核心算法。前向计算得到输出后,损失函数衡量输出与目标的差距,BP 用链式法则把这个误差逐层回传,算出每个参数对误差的贡献(梯度),再据此更新参数。

没有它,深度学习不可能成立——网络有上亿参数,逐个试错不现实,BP 提供了可计算的调整方向。今天大模型的训练,底层仍然是 BP 的变体(配合 Adam 这类优化器)。

一句话:BP 是”把误差摊回到每个参数上”的算法,是神经网络能训练起来的前提。

17. RBF(Radial Basis Function,径向基函数)

RBF 是一类取值只依赖”到某个中心点的距离”的函数,常见形式是高斯函数:离中心越近输出越大,越远越趋近于零。

它主要用在核方法(如 SVM 的 RBF 核)和 RBF 神经网络中,擅长处理非线性可分问题和时间序列拟合。在大模型时代它已不是主流结构,但作为核方法的支柱仍然常见。

一句话:RBF 是按”离中心多远”来决定响应的函数,经典机器学习里的常用工具。

18. CNN(Convolutional Neural Network,卷积神经网络)

CNN 是处理图像的主力结构,核心是卷积核在图像上滑动、逐块提取局部特征,再通过层层堆叠把局部特征组合成整体判断。

两个关键设计是局部连接和权重共享:前者让网络先看局部再拼全局;后者让同一组参数扫描整张图,使模型具备平移不变性(猫在左上角还是右下角都认得出来),同时大幅减少参数量。

人脸识别、医学影像、工业质检、自动驾驶的视觉感知,至今大多仍以 CNN 或其变体为基础。视觉 Transformer(ViT)在数据量充足时表现更好,但 CNN 在数据和算力受限的场景仍有优势。

一句话:CNN 是靠局部感受野加权重共享来看图的网络,计算机视觉的经典架构。

19. RNN(Recurrent Neural Network,循环神经网络)

RNN 是处理序列数据的经典结构,做法是在时间步之间传递一个隐藏状态,让当前的计算能”看到”之前的信息。

它适合语音识别、机器翻译、时序预测这类前后有依赖的任务。致命问题在于梯度消失:序列一长,早期信息的梯度在反向传播中不断衰减,模型就记不住开头。LSTM、GRU 用门控机制缓解了这个问题,但没有根治。

Transformer 之所以取代 RNN,靠的正是自注意力——任意两个位置之间只有一步计算距离,长距离依赖不再是难题,并且可以并行训练。

一句话:RNN 是带记忆的序列模型,思路优雅,但受困于长距离依赖,已被 Transformer 取代。

20. GNN(Graph Neural Network,图神经网络)

GNN 处理的数据结构是”图”——由节点和边组成的网络,不是图片。社交关系、分子结构、知识图谱、交通路网,都是图。

它的思路是让每个节点不断聚合邻居节点的信息,多轮之后,每个节点就带上了它周围结构的信息。因此 GNN 擅长带关系结构的推理,比如判断某个账户是否属于欺诈团伙(看它和谁有资金往来),或者预测分子性质(看原子怎么连接)。

一句话:GNN 在由节点和边构成的关系数据上做学习,处理的是”谁和谁相连”这类问题。

21. GAN(Generative Adversarial Network,生成对抗网络)

GAN 由两个网络组成:生成器负责造假样本,判别器负责分辨真假。两者交替训练,生成器努力骗过判别器,判别器努力识别伪造,最终生成器能造出以假乱真的样本。

在扩散模型出现之前,GAN 是图像生成的主流方案,在人脸合成、图像超分、风格迁移上都有代表性成果。它的短板是训练不稳定(两个网络容易失衡)和模式坍塌(生成结果缺乏多样性),这也是扩散模型后来居上的原因之一。

一句话:GAN 靠生成器与判别器相互对抗来学习数据分布,是生成模型的里程碑式方案。


五、智能体:会干活的 AI

22. 智能体(Agent)

智能体指以大模型为决策核心,能自主拆解目标、调用工具、执行多步任务并根据结果调整的系统。

它和聊天机器人的区别在闭环。聊天机器人一问一答,回答完就结束;智能体拿到目标后先规划步骤,执行一步、观察结果、判断是否达成,没达成继续调整,直到完成或确认无法完成。

Anthropic 对智能体的界定更严格,强调”由模型自主决定流程”——如果步骤是人预先写死的,那叫工作流,不叫智能体。这个区分很实际:流程确定的场景用工作流更可控、成本更低,把开放式的问题交给智能体才划算。

一句话:智能体是能自己走完”规划—执行—检查—修正”闭环的 AI 系统。

23. Function Calling(函数调用)

Function Calling 是让模型输出结构化指令来调用外部函数的能力。模型本身不能查天气、不能发邮件、算不准大数乘法,但它可以判断”这个问题需要调哪个接口、参数是什么”,输出成指定格式,由外部程序执行并把结果送回模型。

它是智能体能用工具的技术前提,也是 MCP 这类标准出现的前提。

一句话:Function Calling 让模型能决定”调用什么、怎么传参”,把执行交给外部程序。

24. Skill(技能)

Skill 是打包好的能力单元:一段说明,加一套流程,可能再附带脚本或参考资料。智能体判断当前任务匹配某个 Skill 时,加载它的说明并按流程执行。

它和 Tool 的区别在抽象层级。Tool 是一个具体接口,比如”读取文件””执行命令”;Skill 是”怎么用一组 Tool 完成一类任务”的说明书,完成一个 Skill 往往要串起好几个 Tool。在 OpenClaw 这类平台里,Skill 是扩展能力的主要方式。

一句话:Tool 是零件,Skill 是用这些零件干一类活的标准流程。

25. Tool(工具)

Tool 是智能体可以调用的外部能力接口,一次调用对应一个明确的动作和输入输出。

它的边界很清楚:Tool 只负责执行,不负责判断该不该执行。什么时候调、传什么参数,由模型决策。因此 Tool 的设计要尽量原子、职责单一、参数明确,泛化的判断留在模型那一层。

一句话:Tool 是智能体伸向外部世界的手,一次调用做一件事。

26. Plugin(插件)

Plugin 指以模块化方式挂载到宿主程序上、用于扩展其功能的组件。装上一个就多一项能力,卸载后不影响主体。

在 AI 领域,Plugin、Skill、MCP Server 这几个词经常混用,区别在接入方式:Plugin 强调与特定宿主的即插即用;Skill 强调任务流程;MCP Server 强调通过统一协议对外暴露能力,任何支持该协议的客户端都能接。

一句话:Plugin 是可插拔的能力模块,关注的是”装上就能用、卸掉就恢复”。

27. Workflow(工作流)

Workflow 是把多步骤任务预先编排好的执行流程,每一步做什么、按什么顺序、什么条件下走哪个分支,都事先定义。

它在工程上的价值是把不可控的东西变可控:步骤固定意味着成本可预估、结果可复现、出错可定位。代价是灵活性,只适用于流程本身足够稳定的任务。当任务的路径无法预先确定时,才轮到智能体自主决策。

一句话:Workflow 是把任务流程写死的编排方式,换取可控、可复现和低成本。


六、AI 之间怎么连接

28. MCP(Model Context Protocol,模型上下文协议)

MCP 是 Anthropic 提出并开源的协议,用于统一”AI 应用如何连接外部工具和数据源”。

在它之前,每接入一个数据源都要为每种客户端各写一套对接代码,M 个客户端乘 N 个工具,是 M×N 的工作量。MCP 把这件事拆成两端:工具提供方按协议实现一次 MCP Server,客户端实现一次 MCP Client,之后任意组合都能直接连通,工作量降到 M+N。

它常被类比成 USB-C:不是发明了新功能,而是把接口标准化了。

一句话:MCP 统一了 AI 连接外部能力的接口,让工具方和客户端各写一次即可互通。

29. A2A(Agent-to-Agent Protocol)

A2A 是 Google 提出、后交由 Linux 基金会维护的协议,解决智能体之间的互操作:如何发现彼此、如何描述自己的能力、如何委派任务、如何交换结果。

MCP 连接的是”AI 与工具”,A2A 连接的是”AI 与 AI”。两者互补:一个智能体可以通过 MCP 用上工具,再通过 A2A 把这套能力以任务的形式提供给另一个智能体。

一个容易被忽略的设计是 Agent Card——每个智能体对外暴露一份描述身份、能力、调用方式的元数据,其他智能体据此决定找谁协作。它和 MCP 的 Server 描述文件解决的是同一类问题,只是对象不同。

一句话:MCP 让 AI 连上工具,A2A 让 AI 连上 AI。

30. ACP(Agent Client Protocol)

ACP 目前主流指的是 Zed Industries 提出的 Agent Client Protocol,规范编辑器与编程智能体之间的通信:编辑器负责界面和文件上下文,智能体负责推理和改动,两者通过统一协议对接,换编辑器或换智能体都不用重新适配。

需要说明的是,ACP 这个缩写历史上还有另一个含义——IBM 等提出的 Agent Communication Protocol,属于智能体之间的通信协议,该方向已并入 A2A,不再独立演进。看到旧的”ACP 对比 A2A”文章,说的通常是后面这个已经停止维护的协议。

一句话:现在的 ACP 规范的是编辑器与编程智能体之间的接口,别与已并入 A2A 的旧协议混淆。

31. Ontology(本体)

本体这个词来自哲学,原指研究”存在什么、以何种方式存在”的分支。搬进计算机领域后,它指的是一件很具体的事:对某个领域里的概念、分类、关系和约束,做一份形式化、显式、可共享的规约。

拆开这句定义,四个词都有分量:

  • 概念:这个领域里哪些东西算一类。比如”客户””订单””工单”。
  • 关系:概念之间怎么连。”订单属于客户””工单用于解决客户的问题”。
  • 约束:什么情况不成立。”一个订单必须且只能属于一个客户””已取消的订单不能再发货”。
  • 形式化、显式、共享:写成机器能读、能推理的格式(常用 W3C 的 RDF、OWL 等),而不是散落在某个人脑子里的常识;而且是多方共同认可的,不是某个系统自己的私有定义。

它的用途是让异构系统对同一批概念形成统一理解。举个具体的:A 系统的”客户”包含潜在客户,B 系统的只算已签约客户,两边的报表口径永远对不上。本体做的事,就是把”客户”这个类拆成更精确的子类,在定义层面写清楚区别,让两边交换数据、统计口径时不再各说各话。

和几个近义词的边界(这是最容易混的地方):

  • 分类法(Taxonomy):只有”上下位”一种关系,是本体的最简单形态。有分类不等于有本体。
  • 知识图谱(Knowledge Graph):本体是骨架,图谱是骨架加上填进去的具体事实。”客户是一个类、订单属于客户”属于本体;”张三是一个客户、订单 A 属于张三”属于图谱。
  • 数据模型 / ER 图:为存储和查询服务,着眼点是表和字段怎么建;本体着眼点在语义,允许基于规则推出没有直接写明的事实(比如由”A 是 B 的父类、B 是 C 的父类”推出”A 是 C 的父类”)。
  • 术语表(Glossary):只有词和解释,没有关系,也没有约束,因此无法推理。

为什么在 AI 时代又被反复提起:当智能体多起来,问题就从”能不能连上”变成了”连上以后说的是不是同一件事”。MCP 解决了连接,A2A 解决了协作,本体解决的是语义对齐。RAG 检索效果不理想,很多时候也不是向量模型不行,而是同义词、别名、上下位关系没有被归一——用户问”退货”,资料里写的是”售后逆向流程”,中间缺的正是这层语义映射。

典型的本体包括 schema.org(网页结构化标注)、医疗领域的 SNOMED CT、金融领域的 FIBO。

一句话:本体是给一个领域定下的共同语言——有哪些概念、怎么分类、什么关系、什么不能违反,写在明处,机器可读。


七、工具生态:几个容易混的 Agent 产品

很多人把 OpenClaw、Codex、Claude Code、Hermes 一并归为”AI 编程工具”,这是常见的误解。它们定位差别很大:有的专攻编程,有的做通用个人助手,有的主打自我进化。搞清楚各自是干什么的,比记住名字更重要。

32. OpenClaw

OpenClaw 是开源的个人 AI 助手,不是编程工具,由奥地利开发者 Peter Steinberger 于 2025 年 11 月创建,早期名为 Clawdbot。2026 年 3 月,其 GitHub 星标超过 28 万,超过 Linux 成为 GitHub 历史星标第一。

它的定位可以拆成三块:

  • 多渠道入口:通过 WhatsApp、Telegram、Discord 等消息平台接收指令,多个入口收敛到同一套处理流程;
  • 工具执行:借助浏览器、命令执行、网页抓取等工具完成订票、整理报表、抓取数据、处理邮件这类真实任务,不只是写代码;
  • 自动化:支持定时任务、Webhook 触发、邮件订阅等,用于告警、报表和日常流程。

它面向本地部署,可对接 GPT、Claude、DeepSeek 等多种模型,通过 Skill 和 MCP 扩展能力。2026 年 9 月发布的 2.0 版本,从”一人一个智能体”转向多人与多智能体协作,新增共享会话、云端执行、角色权限管理。

一句话:OpenClaw 是通过消息渠道接收指令、用工具执行真实任务的开源个人 AI 助手。

33. Codex

Codex 是 OpenAI 的编程智能体,用 Rust 编写,运行在本机终端,能读取和修改当前目录的代码、在沙箱策略下执行 Shell 命令、通过 MCP 与外部工具通信,也支持以非交互方式接入 CI/CD 流水线。

它有四种形态:终端 CLI、IDE 扩展(VS Code、Cursor、Windsurf 等)、桌面应用、云端 Agent。其中 CLI 最轻、最快、最易脚本化。

需要 ChatGPT 付费订阅或 OpenAI API Key 才能使用。在编程智能体的竞争格局里,OpenAI 有 Codex,Anthropic 有 Claude Code,加上 DeepSeek Harness,是这一梯队的主要玩家。

一句话:Codex 是 OpenAI 的编程智能体,终端、IDE、桌面、云端四种入口共用同一套能力。

34. Claude Code

Claude Code 是 Anthropic 的编程智能体,与 Codex 正面竞争,同样以终端为主要入口。

它的特点是在项目级别工作:理解整个代码库的结构、跨多个文件做协调修改、运行测试、管理 git 流程,而不是逐行补全。Anthropic 自己的说法是,它不是自动补全,而是一个 agentic 系统——你描述目标,它负责规划、执行、验证和迭代,你只需审查最终结果。

除终端外,它还提供 VS Code / JetBrains 扩展、桌面应用和浏览器入口,支持通过 MCP 接入 GitHub、GitLab、Jira、Slack 等外部系统。使用 Claude 模型,需要订阅或 API 账户。

一句话:Claude Code 是 Anthropic 的编程智能体,在项目级别理解代码库并完成跨文件改动。

35. Hermes

Hermes 是 Nous Research 推出的开源智能体框架,注意它不是大模型的名字。

它的核心机制是经验沉淀:每完成一个复杂任务,就把可复用的做法写成一份技能文档存下来;下次遇到同类任务先查自己的技能库,而不是从零开始。配合跨会话的持久记忆,使用时间越长,积累越多。

其他特点包括多平台接入(Telegram、Discord、Slack、WhatsApp、邮件)、不绑定单一模型(可接 DeepSeek、GPT、Claude 等)、内置文件操作、网页浏览、代码执行、图像生成等工具,以及本地部署。2026 年 2 月发布后,三个月 GitHub 星标超过 14 万。

一句话:Hermes 是会积累经验的开源智能体框架,干过的活会变成下次可复用的技能。

36. Vibe Coding

Vibe Coding 指用自然语言描述需求、由 AI 生成全部代码的开发方式,开发者不再逐行编写,而是通过对话迭代结果。这个词由 Andrej Karpathy 在 2025 年 2 月提出。

它适合的场景很明确:原型验证、个人小工具、一次性脚本——这些场景里”跑起来”比”代码写得好看”重要,返工成本也低。

但把它当成通用开发方式是有代价的:不理解自己系统的代码,意味着出问题无法定位、安全漏洞无法识别、后续维护无从下手。在需要长期维护、多人协作,或者涉及资金与用户数据的系统上,这种做法风险很高。

一句话:Vibe Coding 是让 AI 写代码、人只管描述和验收的开发方式,适合原型,不适合无人把关的生产系统。

37. AI Coding(AI 编程)

AI Coding 指用 AI 参与软件开发这件事的统称,范围比”AI 写代码”宽得多。写代码只是其中一环,需求梳理、方案设计、补全、重构、写测试、排查报错、代码审查、生成文档,都在里面。

按介入深浅,常见形态分三层:IDE 里的行级补全,你写它猜;能跨文件改动的编程智能体,你给目标、它规划并执行;以及把 AI 接进 CI/CD 的自动化环节,比如自动修 lint、自动补测试。

它和 Vibe Coding 不在一个层级上。AI Coding 是这一整类做法的总称,Vibe Coding 是其中一种用法,特点是不读代码、只看结果就接受。同属 AI Coding 的还有另一种用法——把 AI 当结对程序员,每一步改动都过一遍眼,这在生产环境里更常见。工具给到的能力上限,和人实际采用的审查强度,是两件独立的事。

一句话:AI Coding 是 AI 参与软件开发全流程的统称,Vibe Coding 只是其中”只看结果”的那一种用法。


八、AI 工程的几个底层概念

38. Harness Engineering

Harness 原指马具——把力量连接到可以工作的机构上,同时不让它脱缰。在 AI 语境里,它指环绕在大模型周围的整套控制与编排系统。

大模型本身只输出文本。要让它变成能干活的智能体,需要有人负责:把任务拆成步骤、决定什么时候调用哪个工具、管理任务状态、处理失败重试、控制权限边界、记录执行轨迹。这些工作全部属于 Harness 这一层。

DeepSeek 给出的公式很简洁:Model + Harness = Agent。这句话的另一面是,同一个模型换上不同的 Harness,能完成的任务可以差出很远。

一句话:Harness 是大模型外面那层负责调度、控制和闭环的工程系统。

39. Loop(循环)

Loop 指智能体的基本运行方式:观察当前状态,判断下一步动作,执行,观察执行结果,再判断……如此往复,直到任务完成或确认无法完成。

它是智能体区别于普通对话 AI 的分界线。对话式 AI 的输出就是一个回答,输出完即结束;智能体必须能根据执行结果修正下一步动作,而这个”看结果、再调整”的能力,只能在循环里成立。

工程上的难点也集中在这里:循环要有终止条件,否则会陷入反复重试;每多一轮就多一次模型调用,成本和延迟随之上升;错误信息如何回传给模型,直接决定它下一轮能不能纠正。

一句话:Loop 是智能体”执行—观察—调整”的往复机制,没有循环就只是问答。

40. DeepSeek Harness

DeepSeek Harness 是 DeepSeek 推出的开源智能体框架,2026 年 8 月发布开发者预览版,以 MIT 协议开放。

设计原则是”一切皆插件”:模型、工具、技能、会话、沙箱、存储、循环调度、界面等所有能力都以插件形式存在,可以单独替换。它基于 Cordis 插件系统构建,提供四种运行形态:标准模式(完整编码智能体)、PTC 模式(程序化工具调用)、极简模式(只保留核心工具)、创造模式(自定义智能体预设)。

它还支持全轨迹追踪:模型看到的每一步输入都被记录,可追溯、可回放、可分叉。

它和 Codex、Claude Code 的关系,是”框架”与”产品”的差别:后两者装好即用,DeepSeek Harness 提供的是可以改造、可以二次搭建的底座。前者交付的是成品车,后者给的是图纸和零件库。

一句话:DeepSeek Harness 是开源智能体框架底座,一切能力皆可替换,适合要自己搭智能体的团队。


九、AI 落地相关的岗位与理念

41. FDE(Forward Deployed Engineer,前线部署工程师)

FDE 指常驻客户现场的工程师,负责把通用 AI 能力改造成能在客户业务里真正跑起来的方案。这个岗位源自 Palantir——早期服务情报机构时,需求模糊、数据涉密、传统交付方式失效,他们的解法是把工程师直接派进客户办公室,现场理解、现场开发、现场迭代。

工作内容决定了它需要两种能力同时具备:懂技术,能动手写代码、搭系统;懂业务,能听懂客户真正的问题是什么。业内常说,客户买的不是一个软件,而是一个能干活的智能体,而这件事只能发生在客户的真实业务现场。

从 2025 年 4 月到 2026 年 4 月,FDE 相关岗位从 643 个增长到 5330 个,OpenAI、Anthropic、Palantir、Google Cloud 等公司都在招募。

一句话:FDE 是驻场把通用 AI 改造成客户业务方案的工程师,技术能力和业务理解缺一不可。

42. Echo

Echo 是 FDE 体系中的业务侧角色,负责找准问题。

Palantir 的 FDE 采用双人搭档:Echo 与 Delta 配对,Echo 管方向,Delta 管实现。Echo 的具体职责包括深入现场理解业务痛点、识别 AI 能产生最大价值的场景、收集失败案例推动模型改进、把业务语言翻译成产品需求、维护客户关系。

Echo 的人选通常是某个行业的资深从业者——前军官、临床医生、法务会计等,自带行业经验。还有一个常被提及的特质:对现状有判断力,能看出既有做法哪里不够好。这个角色存在的意义,是避免团队”拿着锤子找钉子”。

一句话:Echo 是 FDE 里负责找准问题的一方,把业务需求翻译成技术能执行的东西。

43. Delta

Delta 是 FDE 体系中的技术侧角色,负责解决问题。

职责包括编写 Prompt、配置 Skill、搭建增强器和编排器、快速做出可运行的原型、与企业既有系统对接、完成部署交付。Delta 通常是全栈工程师,核心竞争力是快速把想法变成能跑的东西。

有一个反直觉的选人标准:完美主义的技术工匠反而是错误人选。这个岗位要看的是在限定时间内拿出可用版本,第一版粗糙可以接受,推倒重来也可以,唯独不能慢。

Echo 与 Delta 之间存在刻意的张力:Echo 踩刹车,防止团队钻进技术细节自嗨;Delta 拉警报,避免战略停留在纸面。两者的往复构成一个持续迭代的闭环,而不是一次性的项目交付。

一句话:Delta 是 FDE 里负责解决问题的一方,用最快的速度把方案做成能跑的系统。

44. AI Native(AI 原生)

AI Native 指从设计之初就以 AI 为核心构建的产品或组织,而不是在既有产品上附加 AI 功能。

两者的差别不是程度问题,而是结构问题。附加 AI 功能的产品,流程、数据、组织都是为旧模式设计的,AI 只是新增的一个模块;AI 原生则反过来——业务流程围绕 AI 的能力边界重新设计,人的角色、协作方式、考核标准随之调整。

类比移动互联网:Mobile Native 应用不是把网页塞进手机,而是从一开始就按手机的使用方式设计。同样的道理,AI Native 也不是”加一个 AI 助手”,而是假设 AI 在各个环节都可用之后,重新回答”这件事应该怎么做”。

一句话:AI Native 是围绕 AI 重新设计流程,而不是在旧流程上挂一个 AI 功能。

45. OPC(One Person Company,一人公司)

OPC 指个人借助 AI 算力与智能体工具,独立完成从产品、研发到市场、客服的完整链路,也就是”单人成军”的创业形态。

支撑它成立的是智能体可以承担执行层的工作:写代码、写文案、做图、回复客户、整理数据,一个人调配一组智能体,就能覆盖过去一个团队的职能分工。

现实的边界也要说清楚:AI 承担的是执行,人承担的是判断——做什么、不做什么、什么算做好了。执行可以被自动化,判断不行。另外,法律主体、资金、合规责任并不会因为用了 AI 而转移,OPC 目前更多是一种能力结构的变化,而不是公司形态的替代。

2025 年底以来,苏州、上海、无锡、南京、常州等地陆续推出面向 OPC 的社区与扶持政策,北京朝阳区提出了”超级个体网络”(SICN)。

一句话:OPC 是一个人加一组智能体完成原本需要团队的工作,执行交给 AI,判断留给人。

结语

45 个词列完,其实没有哪个需要背。术语更新得快,今天记住的,明年可能就没人提了。真正稳定的只有一件事:每个新词背后都站着一个具体问题——模型怎么想、人怎么用、系统之间怎么接。遇到没见过的词,先别急着记定义,问一句它解决的是什么问题,这个答案通常比定义本身管用。

更多AI知识,请扫码关注Aiker World社区公众号

Aiker World社区网址:https://aikerworld.com

Aiker World(AI世界)-聚焦AI人才与智能体工具的垂直专家社区。专家领航+人才汇聚+工具赋能,打通AI技术与产业落地断层,为AI从业者、开发者及企业提供一站式成长与协作平台。

本文由安全客原创发布

转载,请参考转载声明,注明出处: https://www.anquanke.com/post/id/316151

安全KER - 有思想的安全新媒体

分享到:微信
+10赞
收藏
安全客
分享到:微信

发表评论

Copyright © 北京奇虎科技有限公司 三六零数字安全科技集团有限公司 安全KER All Rights Reserved 京ICP备08010314号-66