#
来源:马克的技术工坊。
一条从下到上的 AI 概念链,讲清楚 LLM、Token、Context、Prompt、Tool、MCP、Agent、Agent Skill 八个核心概念。
另外这是我写好初始文章,由codex总结排版润色的,deepseek真挺好用😋。
# 1. LLM(大语言模型)— 一切的基础
| 要点 | 说明 |
|---|---|
| 底层架构 | Transformer(Google, 2017 · 论文《Attention Is All You Need》) |
| 引爆点 | OpenAI — GPT-3.5(2022 年底)→ GPT-4(2023 年 3 月) |
| 当前格局 | GPT / Claude / Gemini 等多强争霸 |
| 本质原理 | 文字接龙游戏:每次预测下一个概率最高的词,吐出来塞回输入,再预测下一个,循环往复直到输出结束符 |
# 2. Token(词元)— 模型处理文本的最基本单元
模型只认数字,所以需要 Tokenizer 在人类与模型之间做翻译。
工作流程
- 编码(文字 → 数字)
- 切分:用户输入被拆成最小片段,每个片段叫一个 Token
- 映射:每个 Token 对应到一个 Token ID(数字)
- 解码(数字 → 文字):把模型吐出的 Token ID 翻译回文字
Token ≠ 词。比如"工作坊"被切成 [工作, 坊],"程序员"被切成 [程序, 员]。
平均 1 Token ≈ 0.75 个英文单词 / 1.5~2 个汉字。极端情况:一个对勾字符(✅)可能需 3 个 Token 才能表示。
底层切分算法为 BPE(Byte Pair Encoding),视频另有专题讲解。
OpenAI 官方提供了 Token 可视化页面,可以直观查看任意文本被如何切分。
# 3. Context(上下文)& Context Window(上下文窗口)
| 概念 | 含义 |
|---|---|
| Context | 模型每次处理任务时接收到的信息总和(历史记录 + 系统规则 + 当前输入等),本质是模型的临时记忆体 |
| Context Window | Context 能容纳的最大 Token 数量 |
当前主流模型的 Context Window 普遍在 100 万 Token 左右(约 150 万个汉字)。
相关技术:RAG(Retrieval-Augmented Generation)
面对大量资料(如上千页产品手册),不是全部塞进 Context,而是先检索最相关的片段,只将这些片段送入模型——降低成本和 Token 消耗。
视频另有 RAG 专题讲解。
# 4. Prompt(提示词)
从用户的简单指令到开发者后台配置的约束,Prompt 共同决定了模型的输出行为。
| 类型 | 来源 | 作用 |
|---|---|---|
| User Prompt | 用户直接输入 | 具体任务或问题 |
| System Prompt | 开发者后台配置 | 设定模型角色、人设和做事规则(用户不可见) |
示例:一个数学辅导机器人
- System Prompt:你是一个耐心的数学老师,不要直接给答案,要引导学生思考
- User Prompt:3 加 5 等于几?
- 模型不会说"8",而是说"你手里有 3 个苹果,又拿了 5 个,现在一共有多少个?"
Prompt Engineering 正在衰退——不是因为不重要,而是模型能力越来越强,模糊指令也能大致猜对意图。
# 5. Tool(工具)— 让模型感知外部世界
大模型的先天缺陷:无法获取实时信息(天气、数据库等)。
Tool 本质上就是一个函数——给它输入,它返回输出。
完整调用链路
- 模型分析该用哪个工具,生成调用指令
- 平台实际调用工具函数
- 模型归纳工具返回的结果
- 最终输出给用户
关键认知:模型不会自己调用工具,它唯一的能力是输出文本指令。实际调用由平台完成。
各角色职责
| 角色 | 职责 |
|---|---|
| 模型 | ① 选择工具并生成参数 ② 归纳工具执行结果 |
| 平台 | 串联整个流程:告诉模型可用工具、根据模型指令去调用工具 |
| 工具 | 完成具体的查询/计算任务 |
# 6. MCP(Model Context Protocol)— 统一工具接入标准
痛点:以前每个平台(ChatGPT / Claude / Gemini)有自己的一套工具接入规范,同一个工具要写多遍。
MCP 的作用:定义一套统一标准,工具开发者只写一次,所有支持 MCP 的平台都能用——就像 Type-C 接口。
视频另有 MCP 终极指南系列(3 期),从使用到原理全面讲解。
# 7. Agent(智能体)— 能自主规划的程序
| 要点 | 说明 |
|---|---|
| 定义 | 能够 自主规划 → 自主调用工具 → 持续运作直到完成任务 的系统 |
| 代表产品 | Claude Code、Codex、Gemini CLI、Cowork、OpenClaw 等 |
| 构建模式 | ReAct、Plan and Execute 等经典模式 |
Agent 不再是"问一句答一句",而是面对复杂任务时自己分析、拆解步骤、多次调用工具、最终给出答案。
视频中的多步串联例子:"查天气→下雨→搜附近雨伞店"
- 调用定位工具获取经纬度
- 调用天气工具查询天气(有雨)
- 调用店铺工具搜索附近雨伞店(100 米有全家便利店卖伞)
- 归纳所有信息,输出最终答案
视频另有专题深入拆解了 ReAct 等构建模式的运行流程,甚至手写了一个简化版 Claude Code。
# 8. Agent Skill — 给 Agent 看的说明文档
本质:一份提前写好的 Markdown 文件,告诉 Agent 遇到某类任务该怎么做事。
文档结构
┌─ 元数据层 ─────────────────────────┐
│ Name: go-out-checklist │
│ Description: 出门前帮你查天气、带物品│
├─ 指令层 ───────────────────────────┤
│ 目标 │
│ 执行步骤(先调定位 → 再调天气 → …) │
│ 判断规则(下雨带伞,风大穿外套 …) │
│ 输出格式(先总结句,再列清单) │
│ 示例(给出一组输入→输出的样例) │
└────────────────────────────────────┘
存放规范(以 Claude Code 为例)
- 进入
~/.claude/skills/目录 - 新建文件夹,文件夹名必须等于技能名(如
go-out-checklist) - 文件夹内创建
SKILL.md(必须大写,这是"接头暗号") - 所需工具需提前做成 MCP 工具 并导入
渐进式披露:启动时只读取元数据层;只有用户问题与技能的名称/描述相关时,才加载指令层——节省 Token。
视频另有专题深入讲解 Agent Skill 的使用和原理。
# 体系总结
Agent Skill ← 给 Agent 看的说明文档
↑
Agent ← 能自主规划、调用工具完成任务的程序
↑
MCP ← 工具的统一接入标准协议
↑
Tool ← 让大模型感知外部世界的函数
↑
Prompt ← 给模型的指令(User + System)
↑
Context ← 模型每次处理任务时的信息总和
↑
Token ← 模型处理文本的最基本单元
↑
LLM ← 一切的基础(基于 Transformer 的大语言模型)
理解了这条概念链,无论 AI 圈子里出现什么新产品、新技术,你都能看清它的底层逻辑。

