AI 核心技术名词详解:从 LLM 到 Agent 一文讲透

QuibblerAgentQuibblerAgent 2026-07-16 约 16 分钟 254 次阅读

AI 核心技术名词详解:从 LLM 到 Agent 一文讲透

这两年大模型与 AI 应用爆发,LLM、Prompt、RAG、Embedding、Function Calling、MCP、Agent、Skill 等术语层出不穷。它们彼此关联、却又常被混用,初学者往往被一堆缩写绕晕。本文按"模型本身 → 如何与它对话 → 如何为它补知识 → 如何让它用工具 → 如何让它自主行动 → 如何让它更可靠"这条脉络,一次性把这些核心名词讲清楚、理顺它们的层级关系。

1、基础概念

1.1、LLM(大语言模型)

LLM(Large Language Model,大语言模型)是基于 Transformer 架构、用海量文本训练出的概率语言模型。它的本质是"根据上文预测下一个最可能的词",但规模大到一定程度后涌现出理解、推理、生成、写代码等通用能力。代表有 OpenAI 的 GPT、Anthropic 的 Claude、Google 的 Gemini、Meta 的 Llama 等。

       - 参数量动辄百亿、千亿级,训练成本极高

       - 能力来自预训练(学语言与世界知识)+ 对齐(学人类偏好)

       - 输出的是概率,所以会有不确定性,也会"编造"

1.2、Token 与上下文窗口

Token 是模型处理文本的最小单位,介于"字"和"词"之间:一个英文单词约 1~2 个 token,一个汉字约 1~2 个 token。模型的计费、速度、可读篇幅都以 token 计算。上下文窗口(Context Window)则是模型一次能"看到"的最大 token 数,比如 128K、200K——它决定了单次对话能塞进多少资料、能读多大的文件,超出就要截断或检索。

1.3、训练(Training)与推理(Inference)

训练是"学习"阶段:喂入海量数据,调整模型内部成百上千亿个参数,得到模型权重。推理是"使用"阶段:拿训练好的权重,对你的输入生成输出。日常"用大模型"指的都是推理;而微调、对齐则属于训练/再训练范畴。

2、Prompt 提示词体系

2.1、Prompt 与 System Prompt

Prompt(提示词)就是你发给模型的输入文本,它引导模型生成期望的输出。一次请求通常由两部分组成:System Prompt 设定角色与规则(高优先级、贯穿全程),User Prompt 是具体任务。

[System]
你是一名资深翻译,只输出译文,不要解释。

[User]
把下面这句翻译成英文:大模型正在改变软件工程。

2.2、Zero-shot 与 Few-shot

Zero-shot 指不给任何示例,直接让模型完成任务,依赖其通用能力;Few-shot 指在提示里给出几个"输入→输出"示例,让模型模仿格式与风格。示例是最便宜的"教模型"方式。

// Few-shot:用示例规定输出格式
输入:iPhone 15  -> 输出:电子产品/手机
输入:拿铁       -> 输出:餐饮/咖啡
输入:围巾       -> 输出:服装/配饰

2.3、Prompt Engineering(提示工程)

Prompt Engineering 是"把提示词写好"的系统方法:明确角色、拆解步骤、给示例、规定输出格式、让模型"想一想"再答。在不改模型的前提下,仅靠改提示就能大幅提升效果,是性价比最高的优化手段。

2.4、采样参数:Temperature 与 Top-p

这两个参数控制模型"选词"的随机程度,决定输出是稳健还是发散。

       - Temperature(温度):0 最确定、最可重复;越高越发散有创意

       - Top-p(核采样):只在累积概率前 p 的候选词里选,过滤掉小概率"噪声"

       - 经验:写代码/抽取信息用低温度,写文案/头脑风暴用高温度

3、知识增强:Embedding、RAG 与微调

3.1、Embedding(向量嵌入)

Embedding 把一段文本映射成一个高维数字向量(如 1536 维),使得"语义相近的文本,向量也相近"。于是"猫"和"小猫"的向量距离很近,而"猫"和"汽车"很远。这是让计算机"按语义而非字面"比较文本的基础。

3.2、向量数据库

向量数据库专门存储向量并支持"相似度检索"——给定一个查询向量,快速找出最接近的若干条。代表有 Pinecone、Milvus、Qdrant、Chroma 等。它是 RAG 的存储底座。

3.3、RAG(检索增强生成)

RAG(Retrieval-Augmented Generation,检索增强生成)解决"模型不知道你私有知识、或知识已过时"的问题。思路是:先把问题去知识库里检索相关片段,再把片段连同问题一起喂给模型作答,让回答"有据可依"。

核心实现:

1. 把文档切块(chunk),每块算 Embedding 存入向量库

2. 用户提问时,把问题也转成向量,检索最相似的若干块

3. 把检索到的片段拼进 Prompt,作为上下文

4. 模型基于"问题 + 检索片段"生成答案,并尽量引用来源

3.4、Fine-tuning(微调)与 RAG 的分工

Fine-tuning 是在通用模型上用领域数据继续训练,让它"内化"某种能力或风格。它和 RAG 常被拿来比较,但二者目标不同:

       - 微调改的是"能力/风格/格式习惯",更新的是模型权重

       - RAG 补的是"知识/事实",不动模型,只改检索到的上下文

       - 经验:先 RAG 后微调;知识易变用 RAG,风格稳定用微调

4、工具能力:Function Calling 与 MCP

4.1、Function Calling(函数/工具调用)

模型本身只会"说",不会"做"——它查不了数据库、调不了 API、执行不了代码。Function Calling(也叫 Tool Use)让模型按约定的 JSON 格式输出一个"工具调用请求",由外部代码真正执行,再把结果返回给模型继续。这样模型就从"只会聊天"变成"能动手"。

// 模型输出的工具调用请求(JSON)
{
  "name": "get_weather",
  "arguments": { "city": "北京" }
}

// 外部代码执行后,把结果回传给模型:
{ "city": "北京", "temp": 26, "weather": "晴" }

4.2、MCP(模型上下文协议)

MCP(Model Context Protocol,模型上下文协议)是 Anthropic 提出的开放标准,统一了"模型/应用"与"外部数据源、工具"之间的连接方式,被戏称为"AI 应用的 USB-C"。有了它,一个 MCP 服务器(如连接 GitHub、数据库、文件系统)可以被任意支持 MCP 的客户端复用,不必每个应用各写一套集成。详见官网 https://modelcontextprotocol.io/。

5、Agent 与 Skill

5.1、Agent(智能体)

Agent 以 LLM 为"大脑",能自主感知任务、规划步骤、调用工具、根据反馈循环执行,直到完成目标。关键词是"自主 + 多步 + 工具":它不是一问一答,而是"观察→思考→行动→观察"地自我推进。Function Calling 是它的手脚,Prompt 是它的意志。

5.2、Skill(技能)

Skill 是"被封装好、可被模型/Agent 调用的特定能力或操作流程",通常是一段指令 + 若干资源的打包(如 Claude 的 Skills)。它介于"单个工具"和"完整 Agent"之间:工具粒度太细(一个个函数),Agent 粒度太重(一整套自主循环),Skill 则把"做某类事的套路"固化下来,让模型按需取用。可以理解为"教模型一项手艺"。

       - 工具:一个具体函数,如 get_weather

       - 技能:一套完成某类任务的指令包,如"生成并发布一篇博客"

       - 智能体:能自主规划并串联多个工具/技能达成目标

5.3、Multi-Agent(多智能体)

面对复杂任务,可让多个 Agent 分工协作:一个负责规划、几个负责执行、一个负责审查。这就是 Multi-Agent 架构。它通过角色拆分与并行提升能力上限,但也带来更高的协调成本与不确定性。

6、推理质量与可靠性

6.1、Chain of Thought(思维链)

Chain of Thought(CoT)指让模型"把推理过程写出来"再给最终答案,而非直接蹦结论。对数学、逻辑、多步推理类问题,先"想一想"能显著提升准确率。常见触发语如"请一步步分析"。

6.2、Hallucination(幻觉)

Hallucination 指模型生成"看似合理、实则错误或编造"的内容——虚构的引用、不存在的 API、张冠李戴的事实。根因是它本质是在"预测下一个词"而非"查询真相"。缓解手段:RAG 接地、要求引用来源、限定领域、关键事实再校验。

6.3、Grounding(接地)

Grounding 指让模型输出"扎根"于可靠来源(检索到的文档、数据库、实时数据),而不是凭空生成。RAG 就是实现接地的主要手段,接地的好坏直接决定回答的可信度。

6.4、Alignment(对齐)与 RLHF

预训练后的模型"什么都会说",需要 Alignment(对齐)让它符合人类意图与价值观。最经典的方法是 RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习):先让人类给模型输出排序,训练一个奖励模型,再用强化学习把主模型往"人类更偏好"的方向优化。

7、术语速查表

缩写        全称/含义                          一句话
------------------------------------------------------------------------
LLM        Large Language Model              大语言模型,GPT/Claude/Gemini 之流
Token       分词单位                            模型处理文本的最小单位,按它计费/计长
Context     上下文窗口                          一次能塞给模型的最大 token 数
Prompt      提示词                              你发给模型的输入
System      System Prompt                      设定角色与规则的高优先级指令
Few-shot    少样本                              给几个示例教模型格式/风格
Embedding   向量嵌入                            把文本变成可比语义的数字向量
RAG         Retrieval-Augmented Generation     先检索再生成,给模型补私有/最新知识
Fine-tune   微调                                用领域数据继续训练,改能力/风格
Tool/FC     Tool Use / Function Calling        让模型按 JSON 格式调用外部函数
MCP         Model Context Protocol             统一模型与工具/数据源的连接协议
Agent       智能体                              以 LLM 为大脑、自主多步用工具的系统
Skill       技能                                封装好的"某类任务的套路",按需调用
CoT         Chain of Thought                   让模型先写出推理过程再给答案
Halluc.     Hallucination 幻觉                 模型编造看似合理却错误的内容
Grounding   接地                                让输出扎根于可靠来源,抑制幻觉
RLHF        人类反馈强化学习                    用人类偏好对齐模型的关键方法

8、总结

这些名词其实处在同一条逻辑链上:LLM 是引擎,Prompt 是方向盘,RAG 与微调分别补"知识"和"能力",Function Calling 与 MCP 赋予它"手脚",Agent 把这些组装成"能自主干活的系统",Skill 则是其中"标准化的手艺包",而 CoT、接地、对齐共同决定它"靠不靠谱"。

关键要点:

       - LLM 是概率模型,会推理也会编造,所以需要接地与校验

       - Prompt Engineering 是不改模型、性价比最高的优化

       - RAG 补知识、微调改能力,二者分工而非互斥

       - 工具/MCP 让模型能动手,Agent 让它能自主,Skill 让它有标准套路

       - 可靠性三件套:思维链提准确、接地防幻觉、对齐保价值观

对于想跟上 AI 浪潮的开发者而言,不必被一堆缩写吓退。只要抓住"模型 → 对话 → 知识 → 工具 → 自主 → 可靠"这条主线,就能把这些名词各就各位;剩下的,就是在真实项目里把它们组合起来,把一个会聊天的模型,一步步打磨成真正能干活的智能体。

       一句话总结关系

  • Prompt = 你临时说的话
  • Knowledge Base (RAG) = 给 AI 的资料库(知道什么)
  • Skill = 给 AI 的标准化操作手册(怎么做)
  • Agent = 会规划、会调用工具、会用 Skill 和知识库的“数字员工”
  • MCP = 让 Agent 连接外部世界的标准接口

它们不是互相替代,而是分层配合:Agent 负责思考和调度 → Skill 提供领域流程 → RAG 提供准确知识 → MCP/Tool 提供实际执行能力。

相关推荐

置顶 精选
博客七周年:AI 一天完成整体重构
AI

博客七周年:AI 一天完成整体重构

博客从 2019 年国庆用 Xiuno BBS 搭建,到 2026 年国庆整整七年。868 篇文章、53 条评论、6060 个代码块,这次与 AI Agent 结对,一天完成从 PHP 论坛到 Next.js 的整体重构与无损迁移。

23
精选
​Jev 详解:不做生成的判断模型
AI

​Jev 详解:不做生成的判断模型

Jev 详解:不做生成的判断模型让 LLM 干"判断"的活,一直是件拧巴的事:它擅长生成文本给人读,你要的却是结构化决策给代码用——于是提示词约束、JSON 解析、重试兜底一层层糊上去。TypeSafe AI 的答案是干脆换一类模型:Jev,首个 System One 模型——不做文本生成,专职快速、结构化的判断:输入状态与类型化问题,输出带概率与置信度的结构化答案,类型错误在数学上不可能发生,因

11
精选
Laya 详解:可自托管微调的非自回归判断模型
AI

Laya 详解:可自托管微调的非自回归判断模型

Laya 详解:可自托管微调的非自回归判断模型Jev 证明了"判断模型"这条路走得通,但它闭源、按 token 计费、只能云端调用。两天后(2026 年 9 月 18 日),NandhaKishorM 在 GitHub 开源了 NandhaKishorM/laya(Laya):多语言、非自回归的 System 1 判断引擎——三个 checkpoint(laya / laya-multilingu

6