BotOf TechAI / IoT / Full-Stack / 植物养护知识分享
返回首页企业级 AI Agent 平台搭建:别先选框架,先把六个控制面拆开

企业级 AI Agent 平台搭建:别先选框架,先把六个控制面拆开

企业搭 Agent 平台时最容易从框架选型开始:LangGraph 还是 ADK,云服务还是自建,单 Agent 还是多 Agent。半年后往往得到几十套无法统一治理的 Demo。真正长期稳定的部分不是框架,而是身份、数据、工具、运行、策略和评测这些企业责任边界。

OpenAI Frontier 强调共享业务上下文、执行环境、反馈学习和独立身份;Gemini Enterprise Agent Platform 把 Agent Runtime、Identity、Registry、Gateway、Memory 与 Observability 放入同一平台;Microsoft 9 月 3 日对企业 AI 的最新判断也强调多模型、数据重力与端到端运维。厂商实现不同,但平台能力已经出现清晰交集。

六个面,而不是一个万能编排器

流程图:企业级 AI Agent 平台的六个控制面。身份、知识、运行、工具、治理和评测形成分层平台,并通过策略和评测反馈控制生产动作。

六个控制面可以由模块化单体起步,但数据所有权、授权边界和反馈关系必须从第一天就拆清楚。

1. 身份与租户面

每个 Agent 都要有稳定身份、所有者、环境、版本和用途;每次运行还要携带发起用户与委派链。Agent 身份不等于服务账号:服务账号回答“谁连接”,任务 capability 回答“本次允许做什么”。离职、项目下线或 Agent 过期时,平台必须能查出并撤销所有派生权限。

2. 知识与上下文面

企业知识不是一个大向量库。结构化业务事实留在系统 of record;文档检索保存来源、ACL 和版本;会话记忆有保留期与删除策略;临时工作上下文随任务结束回收。检索必须在召回前执行权限过滤,不能先取出敏感片段再要求模型“不要说”。

3. Agent 运行面

Runtime 管理长任务状态、检查点、队列、Sandbox、模型路由和预算。每个 run 都要可暂停、取消、恢复和超时;版本升级时定义旧任务由旧版本继续还是迁移。对多模型平台,统一的是任务与工具契约,不是把不同模型硬塞进相同 prompt。

4. 工具与动作面

所有外部动作经过 Gateway:工具注册、schema 校验、凭证代理、幂等、速率限制和策略裁决在这里发生。MCP 解决能力描述与调用互操作,但不天然提供企业授权;A2A 解决 Agent 间协作,也不替代委派链审计。

5. 治理与审计面

治理面将数据分类、动作风险和业务策略转成运行时决定。低风险读操作可自动允许;可逆写操作记录补偿;高后果动作要求双人或分级审批。审计事件保存输入引用、模型、策略版本、工具参数摘要、结果 receipt 和人工决定,而不是只存一段聊天记录。

6. 评测与运营面

评测要覆盖离线任务集、影子流量、线上质量、成本和安全。平台应把真实失败聚类后回灌测试集,但不能直接让线上日志无筛选地成为训练数据。指标以完成业务结果为中心:任务成功率、人工接管率、重复副作用、越权阻断、每个成功结果成本与恢复时间。

推荐的组件边界

平台组件持有的数据核心接口
Agent RegistryAgent、版本、Owner、风险等级publish / deprecate / discover
Run Servicerun、step、checkpoint、budgetstart / resume / cancel
Tool Gatewaytool、schema、credential bindingauthorize / invoke / receipt
Context Serviceknowledge、memory、ACL、TTLretrieve / remember / forget
Policy Servicerule、decision、evidenceevaluate / explain
Evaluation Servicedataset、grader、release gaterun / compare / promote

这些组件可以先由一个模块化单体实现,不需要第一天拆成六个微服务。重要的是数据所有权和接口语义独立,避免编排框架同时成为权限库、记忆库和审计库。

三阶段建设路线

第一阶段选择一个高价值、低不可逆风险的工作流,打通统一身份、工具网关、运行事件和人工接管。第二阶段建设 Registry、评测门禁、成本与多租户配额,把多个团队纳入同一交付流程。第三阶段再开放跨 Agent 委派、多模型路由、长任务与自助 Agent Studio。

每阶段都要有退出条件。POC 阶段不是看 Demo 是否惊艳,而是 100 个真实任务能否给出稳定结果;平台阶段不是看 Agent 数量,而是所有生产 Agent 是否有 Owner、版本、权限、SLO 和下线日期;规模化阶段则要证明一次模型或策略升级不会同时击穿全部工作流。

最容易失败的三种架构

第一种是“超级编排器”:所有状态、工具和权限都绑定在一个框架里,换框架就全盘迁移。第二种是“共享万能账号”:Agent 能做很多事,却无法还原代表谁行动。第三种是“日志即治理”:事后能看到错误,但动作发生前没有策略执行点。

企业级 Agent 平台的价值,不是让任何人一分钟创建一个 Agent,而是让一个 Agent 从创建、测试、审批、发布、运行到下线都留下可管理的生命周期。模型会快速更替,这六个控制面才是企业真正应长期持有的资产。

参考资料