AI完整分层架构:从底层大模型到Agent应用产品
很多人把大模型、RAG、工具调用、Agent混为一谈。实际上现代AI系统是一套分层堆叠的体系,自下而上逐层赋能:底层大模型只负责理解与生成,经过记忆增强、工具扩展、智能体决策,最终才变成面向用户的业务产品。
生活化类比,类比一家餐厅:
- 基础层:后厨的厨师,负责做菜(大模型LLM);
- 上下文层:菜单、顾客的点餐记录、食材参考资料(记忆、RAG、提示词);
- 能力扩展层:厨具、采购渠道(搜索、数据库、各类工具,MCP相当于统一的厨具接口标准);
- 智能体层:店长,拆解任务、排工序、统筹干活(Agent规划、循环执行);
- 应用层:对外营业,套餐、服务,直接接待顾客(业务工作流、SaaS产品)。

第一层:基础层(模型底座)——AI的计算大脑
这是整套系统最底下的地基,代表Transformer大模型本体。
核心组件:Transformer架构、Token分词、注意力机制、预训练权重。
- Token:模型处理文本的最小单元,中文汉字、英文单词都会被切分成token,同时也是计费、上下文窗口大小的计量单位。
- 注意力机制:让模型看懂上下文文字之间的关联关系。
注意:基础层大模型只会做文本理解和生成。它本身不能联网、不能读数据库、没有记忆,也不会自主规划任务。
就像厨师只会烹饪,不知道今天顾客需求,没有食材,也不会自己安排整个餐厅运营。
第二层:上下文层(记忆加工层)——给大脑准备资料
光有厨师还不够,要把顾客需求、历史对话、参考资料整理好再交给模型。这一层负责管理全部输入信息,解决“模型能看到什么”的问题。
核心组件:Context Window上下文窗口、Prompt提示词、短期记忆、长期记忆、RAG检索增强生成。
- 上下文窗口Context Window:相当于厨师的操作台,有固定大小,能同时摆放的资料有限,超出容量的信息模型就看不见。
- Prompt系统提示词:设定角色、规则、约束,告诉模型该怎么做事。
- 记忆Memory
- 短期记忆:本次会话的全部对话、工具返回结果,保存在上下文窗口;
- 长期记忆:借助向量数据库,跨会话保存用户偏好、历史经验。
- RAG检索增强生成:从私有知识库检索文档片段,把参考资料塞给上下文,用来降低幻觉,让回答有据可依。
这一层解决:给模型喂什么信息、记住什么、哪些资料可以拿来参考。但此时AI依旧只会被动回答,还不会主动动手执行外部操作。
第三层:能力扩展层(工具层)——给AI配上手脚
大模型只是“会想会说”,无法直接触碰外部世界。能力扩展层提供各类工具,让AI可以和真实世界交互。
核心组件:Tool Calling工具调用、各类工具(搜索、代码解释器、数据库、API)、MCP模型上下文协议。
MCP(Model Context Protocol)通俗理解:AI世界的USB‑C通用接口。
在没有MCP之前,每对接一个数据库、一个API,就要单独写一套适配代码。MCP是一套开放标准,工具只要遵守这个协议,Agent就可以即插即用,不用重复写对接胶水代码,大幅降低工具接入成本。
工具的常见类型:
- 信息获取:网页搜索、数据库查询;
- 计算处理:Python代码解释器;
- 系统交互:读写文件、发送消息、调用第三方业务接口。
重要认知:大模型只负责思考,输出调用工具的指令;真正执行动作,全部由外部工具完成。
第四层:智能体层(决策层)——自主规划,闭环干活
有了大脑、资料、工具,还需要管理者,也就是Agent智能体层。这一层实现目标拆解、任务规划、循环迭代执行,也就是ReAct思考‑行动‑观察闭环。
核心组件:Agent主体、Explore探索、Plan规划、Act行动循环。
主要能力:
- 目标理解:读懂用户的高层目标;
- 任务拆解规划:把大目标拆成多个子步骤;
- 循环闭环:思考→调用工具→拿到结果→再思考,循环往复;
- 结果判断:判断信息是否足够,任务是否完成。
到这一层,AI不再是一问一答的聊天机器人。用户只需要下达最终目标,Agent自己规划步骤,调用工具,直到完成任务。
同时工程上在这里增加保护逻辑:最大循环次数、异常捕获,防止无限死循环。
第五层:应用层(行动输出层)——面向业务交付产品
最上层,面向真实业务、面向终端用户。把Agent能力封装成业务可用的服务。
核心组件:Agent Skill定制技能、Workflow工作流、自动化业务流程。
比如企业内部文档助手、AI编程助手、自动化报表系统、行业SaaS产品。
很多场景不会完全放任Agent完全自由决策,而是把高频业务流程固化为工作流,兼顾自主性与业务稳定性。
完整的一条数据流:用户提需求到返回结果
我们完整走一遍整个五层的数据流:
- 用户下发自然语言指令,请求进入系统;
- 上下文层:读取会话记忆,RAG检索相关知识库,把用户指令、历史对话、参考资料整理为上下文;
- 基础层LLM:接收整理好的上下文,做推理理解;
- 智能体层Agent:判断目标,规划子任务,决定是否调用工具;
- 能力扩展层:通过MCP协议调用搜索/数据库等工具,拿到外部执行结果;
- 工具结果重新回送到上下文层,再次交给大模型;
- 多次循环,直到Agent判定任务完成;
- 应用层:把最终结果整理,返回给终端用户,同时保存交互记录到记忆。

容易混淆的概念区分
- 只有基础层LLM:普通聊天对话,只能输出训练知识,不能获取实时信息,不能执行操作;
- LLM+上下文层+RAG:知识库问答系统,现在大量企业知识库就是这个层级,能读私有文档,但不会自主多步骤规划;
- LLM+上下文+工具层:具备工具调用能力,可以按需调用搜索、代码,但缺少自主任务循环;
- LLM+上下文+工具+Agent智能体层:完整智能体,可以接收目标,自主多步骤完成复杂任务;
- 叠加应用层:封装成可以直接给业务人员使用的成品产品。
现实开发启示:不是所有业务都一定要上完整Agent。
- 如果只需要文档问答:做到RAG(第二层)就足够;
- 如果只需要偶尔调用一次搜索、代码:做到工具调用(第三层);
- 只有需要多步骤、自主循环完成目标,才需要引入Agent智能体层。
写在最后
AI系统不是单一的大模型,而是层层叠加的完整体系。
- 基础层LLM:负责聪明思考;
- 上下文层:管好记忆与参考资料;
- 能力扩展层:靠工具接触真实世界,MCP让工具接入更简单;
- 智能体Agent层:实现目标驱动、循环自主执行;
- 应用层:封装成最终业务产品。
很多人遇到AI效果差,第一反应就是换更强的大模型。但问题也可能出在上层:记忆检索错误、工具调用异常、Agent规划逻辑缺陷。整套系统每一层,都会最终影响用户体验。
0 条笔记