你每天用的对话AI、代码助手、文案生成工具,背后都离不开“大模型”这个核心。但Token、RAG、Agent这些名词听起来总像技术黑话?其实整条技术链路并不复杂,我们用生活化的类比把它串起来,你就能看懂大模型到底是什么、怎么训练、怎么干活、怎么优化。
一、大模型到底是什么?本质是“猜词高手”

1. LLM大语言模型:靠概率续写文字
我们常说的大模型(LLM,Large Language Model),本质是一个“预测下一个词”的概率模型。它读了海量的网页、书籍、代码,学会了语言的统计规律——给它上半句,它就能算出下半句最可能出现什么词,连起来就是通顺的回答。
你看到的流畅对话、生成的代码与文案,底层都是它一个词一个词“推算”出来的。
2. Transformer与注意力机制:会抓重点的阅读方式
几乎所有现代大模型都基于Transformer架构,它最核心的创新是注意力机制。
打个比方:普通人读一句话是逐字扫过去,而注意力机制会让模型自动判断——“这个词和前面哪个词关系最紧密”。比如读“我把苹果放在桌子上,它很红”,模型会自动把“它”和“苹果”关联起来,而不是“桌子”。
正是这个机制,让大模型真正读懂了上下文语义。
3. Token:模型的“文字积木”
模型不按“字”或“单词”处理文本,而是按Token(词元)切分。一个Token可能是一个完整的词,也可能是半个词、一个汉字。
这个概念和你直接相关:
- 大模型的“记忆长度”(上下文窗口)按Token计算;
- 调用API的费用也按Token计费。
比如英文“Hello world”会被切成2个Token,而中文切分规则更复杂,不能简单用“字数乘系数”估算Token数量。
4. 参数量与上下文窗口
- 参数量:可以理解成模型的“神经元数量”,单位是B(十亿)。7B、70B就代表70亿、700亿参数。参数越多,模型的能力上限通常越高,但训练和运行成本也越贵。
- 上下文窗口:模型一次能“记住”的最大Token数。窗口越大,一次能处理的文档越长,对话记忆也越久。
二、大模型是怎么“炼”成的?四步从“书呆子”到“好助手”

一个能自然对话、听话办事的大模型,不是一次性训练出来的,要经过四层修炼:
第一步:预训练——读万卷书
用海量无标注的文本(网页、书籍、代码等)让模型学习语言规律、常识和逻辑。这一步耗费算力最大,是模型能力的基础。
但这时的模型像个“博览群书却不会交流的书呆子”——只会续写文本,不会按你的指令回答问题。
第二步:SFT监督微调——学答题
用人工标注好的“问题-答案”成对数据,教模型学会“听指令做事”。比如问“什么是Python”,它要学会给出解释,而不是接着“什么是Python”往下续写无关内容。
第三步:RLHF人类反馈强化学习——越答越合心意
让人类对模型的多个候选回答打分排序,再用这些反馈继续训练模型。目的是让输出更符合人类偏好:更有用、更诚实、更安全。
也有用AI代替人类打分的方案(RLAIF),能大幅降低标注成本,效果接近真人反馈。
第四步:对齐——做“听话又安全”的AI
对齐是贯穿全程的目标:让模型的行为、价值观符合人类的期望。简单说就是:有用、诚实、不做坏事。前面的SFT、RLHF本质都是实现对齐的手段。
除此之外还有个常见架构:MoE混合专家模型。模型里藏着多个“专家子网络”,处理问题时只激活相关的那部分,不用全部参数都上阵。这样既能扩大模型规模,又能控制计算量,做到“参数大、推理快”。
三、我们怎么用好大模型?提示词就是“指挥棒”

和大模型打交道的核心是Prompt(提示词),你输入的指令直接决定它输出的质量。研究怎么写好提示词的技巧,就叫提示词工程。
1. System Prompt:提前定好“人设”
在你正式提问之前,先给模型设定角色和行为规则,这就是系统提示词。比如“你是专业的Python编程助手,只回答技术相关问题”。
- System Prompt管“模型该怎么做”
- 用户消息管“具体要做什么”
设定好系统提示,多轮对话的风格和边界都会更稳定。
2. 温度:控制“创造力”的旋钮
温度(Temperature)是个0~2之间的数值,控制输出的随机性:
- 接近0:回答非常确定、稳定可复现,适合写代码、数据提取、事实问答;
- 0.3~0.7:平衡稳定和灵活,适合日常对话、翻译、内容总结;
- 0.8~1.2:更有创意、更多样,适合文案创作、头脑风暴;
- 大于1.2:高度随机,容易跑偏,仅特殊创意场景谨慎使用。
3. 思维链(CoT):让它“一步步想”
遇到数学题、逻辑推理题,直接提问很容易答错。只要在提示里加一句“请一步步思考并说明过程”,准确率会大幅提升。这就是思维链(Chain-of-Thought)——让模型把推理过程拆出来,而不是直接跳到结论。
4. 绕不开的缺陷:幻觉
大模型经常会一本正经地胡说八道,生成看似合理、实际错误或凭空编造的内容,这就是幻觉(Hallucination)。
根源在于它本质是“猜最可能的词”,不是“查证事实”。缓解幻觉最主流的方案,就是下面要说的RAG。
四、让大模型连接真实世界:从“会聊天”到“会干活”

纯大模型只能用训练时学过的知识回答,不知道最新信息,也不能动手做事。下面这些技术,就是给它装上“知识库”和“手”。
1. Embedding与向量数据库:让AI懂“语义”
Embedding(嵌入)就是把文字、图片转换成一串数字(向量)。两段话意思越相近,它们的向量距离就越近。
有了这个,计算机就能判断“这句话和那句话语义像不像”。专门存储和检索这些向量的数据库,就叫向量数据库(比如Milvus、Chroma),是语义搜索的核心底座。
2. RAG:先查资料再回答,专治胡说八道
RAG(检索增强生成)的逻辑非常朴素:
- 先把你的文档、知识库转成向量存起来;
- 用户提问时,先从库里搜出最相关的资料;
- 把资料+问题一起交给大模型,让它只根据资料回答。
这样既能解决知识过时的问题,又能大幅减少幻觉,是企业落地大模型最常用的方案。
3. Function Calling:让AI调用工具
大模型本来只能输出文字,Function Calling(函数调用)让它能调用外部工具:查天气、做计算、查数据库、发邮件……
运作方式很简单:第一轮模型判断“该调用哪个工具、传什么参数”,你的代码执行完工具,第二轮把结果传回给模型,它再整理成自然语言回答你。
这一步,让大模型从“聊天机器人”变成了“能做事的工具”。
4. MCP:AI世界的“USB接口”
**MCP(模型上下文协议)**是一个开放标准,相当于给所有工具做了统一的接口。以前每接一个工具都要单独开发对接,现在只要遵循MCP协议,就能被各种大模型直接调用,大大减少了重复工作量。
5. Agent:能自主干活的“数字员工”
Agent(智能体)是比单轮对话更高级的形态:它能自己规划任务、调用工具、多步执行,直到完成目标。比如自动完成“查资料→写代码→跑测试→改Bug”整套流程。
Agent的核心循环叫ReAct:思考(Reason)→行动(Act)→观察结果(Observe)→再思考,循环往复直到任务完成。
6. 多模态:不止读懂文字
多模态大模型能同时处理文本、图片、音频、视频。你可以发一张截图让它解释,发一段语音让它转写,它都能理解。现在主流大模型基本都具备多模态能力。
五、让大模型跑得更快更省:两大优化手段
大模型能力越强,体积越大、运行成本越高。落地到生产环境,通常要做轻量化优化。
1. 量化:压缩精度,降本提速
把模型参数从高精度的32位浮点数,压缩成8位甚至4位整数。就像把高清视频压缩成标清,体积变小、加载变快,画质损失却不大,大多数场景都能接受。
量化的核心收益:省显存、提速度,通常不需要重新训练。
2. 模型蒸馏:老师带学生
用一个能力强、体积大的“教师模型”,去训练一个体积小的“学生模型”。让小模型尽量学到大模型的能力,最终得到一个体积小、速度快、成本低,效果又接近大模型的版本。
蒸馏适合需要低成本上线、大规模部署的场景。
六、新手入门路径:循序渐进四步走
不用一次性吃透所有概念,按这个顺序学,上手最快:
- 第一步:搞懂LLM、Token、Prompt,学会调用API完成基础对话;
- 第二步:学习Embedding、向量数据库、RAG,给模型接入外部知识库;
- 第三步:掌握Function Calling、Agent,让模型自主完成复杂多步任务;
- 第四步:了解微调、量化、蒸馏,应对生产环境的部署与性能优化。
写在最后
大模型听起来很玄,其实核心逻辑非常清晰:
从一个“只会猜下一个词”的概率模型,一步步学会听指令、接知识、调用工具、自主规划,最终从“聊天助手”进化成能独当一面的“数字员工”。
它不是无所不能的神,也不是简单的聊天程序,而是一种正在快速进化的、通用的智能生产力工具。
0 条笔记