自学教程

AI 底层架构

AI完整分层架构:从底层大模型到Agent应用产品

很多人把大模型、RAG、工具调用、Agent混为一谈。实际上现代AI系统是一套分层堆叠的体系,自下而上逐层赋能:底层大模型只负责理解与生成,经过记忆增强、工具扩展、智能体决策,最终才变成面向用户的业务产品

生活化类比,类比一家餐厅:

  • 基础层:后厨的厨师,负责做菜(大模型LLM);
  • 上下文层:菜单、顾客的点餐记录、食材参考资料(记忆、RAG、提示词);
  • 能力扩展层:厨具、采购渠道(搜索、数据库、各类工具,MCP相当于统一的厨具接口标准);
  • 智能体层:店长,拆解任务、排工序、统筹干活(Agent规划、循环执行);
  • 应用层:对外营业,套餐、服务,直接接待顾客(业务工作流、SaaS产品)。

第一层:基础层(模型底座)——AI的计算大脑

这是整套系统最底下的地基,代表Transformer大模型本体。
核心组件:Transformer架构、Token分词、注意力机制、预训练权重。

  • Token:模型处理文本的最小单元,中文汉字、英文单词都会被切分成token,同时也是计费、上下文窗口大小的计量单位。
  • 注意力机制:让模型看懂上下文文字之间的关联关系。

注意:基础层大模型只会做文本理解和生成。它本身不能联网、不能读数据库、没有记忆,也不会自主规划任务。
就像厨师只会烹饪,不知道今天顾客需求,没有食材,也不会自己安排整个餐厅运营。

第二层:上下文层(记忆加工层)——给大脑准备资料

光有厨师还不够,要把顾客需求、历史对话、参考资料整理好再交给模型。这一层负责管理全部输入信息,解决“模型能看到什么”的问题。

核心组件:Context Window上下文窗口、Prompt提示词、短期记忆、长期记忆、RAG检索增强生成。

  1. 上下文窗口Context Window:相当于厨师的操作台,有固定大小,能同时摆放的资料有限,超出容量的信息模型就看不见。
  2. Prompt系统提示词:设定角色、规则、约束,告诉模型该怎么做事。
  3. 记忆Memory
    • 短期记忆:本次会话的全部对话、工具返回结果,保存在上下文窗口;
    • 长期记忆:借助向量数据库,跨会话保存用户偏好、历史经验。
  4. RAG检索增强生成:从私有知识库检索文档片段,把参考资料塞给上下文,用来降低幻觉,让回答有据可依。

这一层解决:给模型喂什么信息、记住什么、哪些资料可以拿来参考。但此时AI依旧只会被动回答,还不会主动动手执行外部操作。

第三层:能力扩展层(工具层)——给AI配上手脚

大模型只是“会想会说”,无法直接触碰外部世界。能力扩展层提供各类工具,让AI可以和真实世界交互。

核心组件:Tool Calling工具调用、各类工具(搜索、代码解释器、数据库、API)、MCP模型上下文协议

MCP(Model Context Protocol)通俗理解:AI世界的USB‑C通用接口
在没有MCP之前,每对接一个数据库、一个API,就要单独写一套适配代码。MCP是一套开放标准,工具只要遵守这个协议,Agent就可以即插即用,不用重复写对接胶水代码,大幅降低工具接入成本。

工具的常见类型:

  • 信息获取:网页搜索、数据库查询;
  • 计算处理:Python代码解释器;
  • 系统交互:读写文件、发送消息、调用第三方业务接口。

重要认知:大模型只负责思考,输出调用工具的指令;真正执行动作,全部由外部工具完成。

第四层:智能体层(决策层)——自主规划,闭环干活

有了大脑、资料、工具,还需要管理者,也就是Agent智能体层。这一层实现目标拆解、任务规划、循环迭代执行,也就是ReAct思考‑行动‑观察闭环。

核心组件:Agent主体、Explore探索、Plan规划、Act行动循环。

主要能力:

  1. 目标理解:读懂用户的高层目标;
  2. 任务拆解规划:把大目标拆成多个子步骤;
  3. 循环闭环:思考→调用工具→拿到结果→再思考,循环往复;
  4. 结果判断:判断信息是否足够,任务是否完成。

到这一层,AI不再是一问一答的聊天机器人。用户只需要下达最终目标,Agent自己规划步骤,调用工具,直到完成任务。
同时工程上在这里增加保护逻辑:最大循环次数、异常捕获,防止无限死循环。

第五层:应用层(行动输出层)——面向业务交付产品

最上层,面向真实业务、面向终端用户。把Agent能力封装成业务可用的服务。

核心组件:Agent Skill定制技能、Workflow工作流、自动化业务流程。

比如企业内部文档助手、AI编程助手、自动化报表系统、行业SaaS产品。
很多场景不会完全放任Agent完全自由决策,而是把高频业务流程固化为工作流,兼顾自主性与业务稳定性。

完整的一条数据流:用户提需求到返回结果

我们完整走一遍整个五层的数据流:

  1. 用户下发自然语言指令,请求进入系统;
  2. 上下文层:读取会话记忆,RAG检索相关知识库,把用户指令、历史对话、参考资料整理为上下文;
  3. 基础层LLM:接收整理好的上下文,做推理理解;
  4. 智能体层Agent:判断目标,规划子任务,决定是否调用工具;
  5. 能力扩展层:通过MCP协议调用搜索/数据库等工具,拿到外部执行结果;
  6. 工具结果重新回送到上下文层,再次交给大模型;
  7. 多次循环,直到Agent判定任务完成;
  8. 应用层:把最终结果整理,返回给终端用户,同时保存交互记录到记忆。

容易混淆的概念区分

  1. 只有基础层LLM:普通聊天对话,只能输出训练知识,不能获取实时信息,不能执行操作;
  2. LLM+上下文层+RAG:知识库问答系统,现在大量企业知识库就是这个层级,能读私有文档,但不会自主多步骤规划;
  3. LLM+上下文+工具层:具备工具调用能力,可以按需调用搜索、代码,但缺少自主任务循环;
  4. LLM+上下文+工具+Agent智能体层:完整智能体,可以接收目标,自主多步骤完成复杂任务;
  5. 叠加应用层:封装成可以直接给业务人员使用的成品产品。

现实开发启示:不是所有业务都一定要上完整Agent。

  • 如果只需要文档问答:做到RAG(第二层)就足够;
  • 如果只需要偶尔调用一次搜索、代码:做到工具调用(第三层);
  • 只有需要多步骤、自主循环完成目标,才需要引入Agent智能体层。

写在最后

AI系统不是单一的大模型,而是层层叠加的完整体系。

  • 基础层LLM:负责聪明思考;
  • 上下文层:管好记忆与参考资料;
  • 能力扩展层:靠工具接触真实世界,MCP让工具接入更简单;
  • 智能体Agent层:实现目标驱动、循环自主执行;
  • 应用层:封装成最终业务产品。

很多人遇到AI效果差,第一反应就是换更强的大模型。但问题也可能出在上层:记忆检索错误、工具调用异常、Agent规划逻辑缺陷。整套系统每一层,都会最终影响用户体验。

标签:

0 条笔记