#

来源:马克的技术工坊。

一条从下到上的 AI 概念链,讲清楚 LLM、Token、Context、Prompt、Tool、MCP、Agent、Agent Skill 八个核心概念。

另外这是我写好初始文章,由codex总结排版润色的,deepseek真挺好用😋。

🔗 原视频:https://www.youtube.com/watch?v=7qO8-kx3gW8


# 1. LLM(大语言模型)— 一切的基础

要点 说明
底层架构 Transformer(Google, 2017 · 论文《Attention Is All You Need》)
引爆点 OpenAI — GPT-3.5(2022 年底)→ GPT-4(2023 年 3 月)
当前格局 GPT / Claude / Gemini 等多强争霸
本质原理 文字接龙游戏:每次预测下一个概率最高的词,吐出来塞回输入,再预测下一个,循环往复直到输出结束符

# 2. Token(词元)— 模型处理文本的最基本单元

模型只认数字,所以需要 Tokenizer 在人类与模型之间做翻译。

工作流程

  1. 编码(文字 → 数字)
    • 切分:用户输入被拆成最小片段,每个片段叫一个 Token
    • 映射:每个 Token 对应到一个 Token ID(数字)
  2. 解码(数字 → 文字):把模型吐出的 Token ID 翻译回文字

Token ≠ 词。比如"工作坊"被切成 [工作, 坊],"程序员"被切成 [程序, 员]。
平均 1 Token ≈ 0.75 个英文单词 / 1.5~2 个汉字。

极端情况:一个对勾字符(✅)可能需 3 个 Token 才能表示。
底层切分算法为 BPE(Byte Pair Encoding),视频另有专题讲解。
OpenAI 官方提供了 Token 可视化页面,可以直观查看任意文本被如何切分。


# 3. Context(上下文)& Context Window(上下文窗口)

概念 含义
Context 模型每次处理任务时接收到的信息总和(历史记录 + 系统规则 + 当前输入等),本质是模型的临时记忆体
Context Window Context 能容纳的最大 Token 数量

当前主流模型的 Context Window 普遍在 100 万 Token 左右(约 150 万个汉字)。

相关技术:RAG(Retrieval-Augmented Generation)

面对大量资料(如上千页产品手册),不是全部塞进 Context,而是先检索最相关的片段,只将这些片段送入模型——降低成本和 Token 消耗。
视频另有 RAG 专题讲解。


# 4. Prompt(提示词)

从用户的简单指令到开发者后台配置的约束,Prompt 共同决定了模型的输出行为。

类型 来源 作用
User Prompt 用户直接输入 具体任务或问题
System Prompt 开发者后台配置 设定模型角色、人设和做事规则(用户不可见)

示例:一个数学辅导机器人

  • System Prompt:你是一个耐心的数学老师,不要直接给答案,要引导学生思考
  • User Prompt:3 加 5 等于几?
  • 模型不会说"8",而是说"你手里有 3 个苹果,又拿了 5 个,现在一共有多少个?"

Prompt Engineering 正在衰退——不是因为不重要,而是模型能力越来越强,模糊指令也能大致猜对意图。


# 5. Tool(工具)— 让模型感知外部世界

大模型的先天缺陷:无法获取实时信息(天气、数据库等)。

Tool 本质上就是一个函数——给它输入,它返回输出。

完整调用链路

- 模型分析该用哪个工具,生成调用指令
- 平台实际调用工具函数
- 模型归纳工具返回的结果
- 最终输出给用户

关键认知:模型不会自己调用工具,它唯一的能力是输出文本指令。实际调用由平台完成。

各角色职责

角色 职责
模型 ① 选择工具并生成参数 ② 归纳工具执行结果
平台 串联整个流程:告诉模型可用工具、根据模型指令去调用工具
工具 完成具体的查询/计算任务

# 6. MCP(Model Context Protocol)— 统一工具接入标准

痛点:以前每个平台(ChatGPT / Claude / Gemini)有自己的一套工具接入规范,同一个工具要写多遍。

MCP 的作用:定义一套统一标准,工具开发者只写一次,所有支持 MCP 的平台都能用——就像 Type-C 接口

视频另有 MCP 终极指南系列(3 期),从使用到原理全面讲解。


# 7. Agent(智能体)— 能自主规划的程序

要点 说明
定义 能够 自主规划 → 自主调用工具 → 持续运作直到完成任务 的系统
代表产品 Claude Code、Codex、Gemini CLI、Cowork、OpenClaw 等
构建模式 ReAct、Plan and Execute 等经典模式

Agent 不再是"问一句答一句",而是面对复杂任务时自己分析、拆解步骤、多次调用工具、最终给出答案。

视频中的多步串联例子:"查天气→下雨→搜附近雨伞店"

  1. 调用定位工具获取经纬度
  2. 调用天气工具查询天气(有雨)
  3. 调用店铺工具搜索附近雨伞店(100 米有全家便利店卖伞)
  4. 归纳所有信息,输出最终答案

视频另有专题深入拆解了 ReAct 等构建模式的运行流程,甚至手写了一个简化版 Claude Code。


# 8. Agent Skill — 给 Agent 看的说明文档

本质:一份提前写好的 Markdown 文件,告诉 Agent 遇到某类任务该怎么做事。

文档结构

┌─ 元数据层 ─────────────────────────┐
│  Name:        go-out-checklist    │
│  Description: 出门前帮你查天气、带物品│
├─ 指令层 ───────────────────────────┤
│  目标                              │
│  执行步骤(先调定位 → 再调天气 → …)   │
│  判断规则(下雨带伞,风大穿外套 …)     │
│  输出格式(先总结句,再列清单)         │
│  示例(给出一组输入→输出的样例)        │
└────────────────────────────────────┘

存放规范(以 Claude Code 为例)

  1. 进入 ~/.claude/skills/ 目录
  2. 新建文件夹,文件夹名必须等于技能名(如 go-out-checklist
  3. 文件夹内创建 SKILL.md(必须大写,这是"接头暗号")
  4. 所需工具需提前做成 MCP 工具 并导入

渐进式披露:启动时只读取元数据层;只有用户问题与技能的名称/描述相关时,才加载指令层——节省 Token。

视频另有专题深入讲解 Agent Skill 的使用和原理。


# 体系总结

Agent Skill   ← 给 Agent 看的说明文档

Agent         ← 能自主规划、调用工具完成任务的程序

MCP           ← 工具的统一接入标准协议

Tool          ← 让大模型感知外部世界的函数

Prompt        ← 给模型的指令(User + System)

Context       ← 模型每次处理任务时的信息总和

Token         ← 模型处理文本的最基本单元

LLM           ← 一切的基础(基于 Transformer 的大语言模型)

理解了这条概念链,无论 AI 圈子里出现什么新产品、新技术,你都能看清它的底层逻辑。