仿真 Agent 系统不是给仿真软件增加一个聊天框。它将复杂任务编译为结构化计划,让具有不同职责的智能体共享世界状态、调用受约束的工具、进入物理环境执行,并把每一步决策、动作、反馈和判分保存为可重放轨迹。
神太再现仿真 Agent 集群把场景、数据、仿真、评测、决策和学习反馈组织为同一条执行链。客户提交的不是一句等待回答的问题,而是一项需要被规划、调度、验证、恢复和交付的仿真任务。
为什么需要 Agent 集群
真实仿真任务同时包含语义理解、资产检索、空间布局、物理稳定、传感器配置、任务调度、结果判分和故障恢复。由单一模型在一次推理中包办全部环节,会让自然语言的不确定性直接传入物理世界,也会模糊任务失败的责任环节。
Agent 集群通过职责分解解决这一问题:
- Planner将业务目标拆为场景、数据、运行和评测计划。
- Orchestrator管理依赖、事件、资源、顺序、超时、重试与终止条件。
- Worker Agents分别处理资产、场景、传感器、仿真、数据和报告任务。
- 共享世界状态统一保存对象、关系、约束、版本、快照、事件和评测结果。
- Critics从视觉、物理和安全角度检查中间产物与运行结果。
- 仿真环境对智能体动作作出物理和行为响应,形成持续闭环。
集群的最终产物是一组可执行场景、完整运行轨迹、评测证据、失败索引和可供后训练使用的数据,而不是一段不可验证的自由文本。
解决方案与能力全景
1. 任务编译:从业务语言到 Run Spec
任务编译器接收自然语言任务、参考图、地图与资产、业务规则、安全约束、传感器配置和验收要求,输出结构化 Run Spec。
Run Spec 明确定义:
- 任务目标、阶段、依赖、成功条件与停止条件;
- 场景对象、空间关系、初始状态和环境变量;
- 智能体角色、权限、工具、资源和协同关系;
- 观测、动作、事件、状态和数据接口;
- Visual、Physics、Safety Critics 的检查规则;
- 仿真运行参数、随机种子、快照点和恢复策略;
- 评测指标、真值来源和交付数据要求。
编译阶段先检查对象引用、角色依赖、工具参数、约束冲突和终止条件,再将任务交给集群执行。自然语言负责表达意图,结构化契约负责约束执行。
2. Planner 与 Orchestrator
Planner 面向任务结果进行分解,确定需要哪些场景、数据、仿真运行和评测步骤,并建立阶段间的依赖关系。对于复杂任务,Planner 可以把同一目标拆为并行子任务、前置验证和结果汇总。
Orchestrator 把计划转化为可调度的执行图:
- 根据能力与权限选择 Worker Agent;
- 管理串行、并行、条件和循环任务;
- 维护资源占用、优先级、超时与停止条件;
- 监听工具、仿真、Critic 和人工审批事件;
- 触发重试、替代 Worker、快照回滚或重新规划;
- 汇总各角色结果并决定是否进入下一阶段。
Planner 决定“要完成什么和如何拆解”,Orchestrator 负责“何时由谁执行以及失败后如何处理”。两者分离后,任务策略与运行控制可以独立配置。
3. 专业 Worker Agents
Worker Agents 按专业职责组织,每个 Agent 只获得完成其任务所需的上下文、工具和权限:
- 资产 Agent:检索、筛选、版本锁定和依赖检查;
- 场景 Agent:生成场景图、对象关系、布局和场景变体;
- 物理 Agent:配置碰撞体、质量、惯量、关节、接触和稳定条件;
- 传感器 Agent:配置相机、LiDAR、雷达、IMU 及采集参数;
- 运行 Agent:启动、监控、暂停、恢复和终止仿真任务;
- 数据 Agent:采集、标注、清洗、质检、版本化和分发结果;
- 评测 Agent:执行指标计算、失败聚类、版本对比和报告生成;
- 恢复 Agent:依据结构化错误选择重试、替代、回滚或重新规划路径。
每个 Worker 返回结构化结果、状态、证据和错误,不以自然语言描述代替可执行产物。
4. 共享世界状态
共享世界状态是集群协同的共同事实源,包含:
- 场景图、对象、部件、关系、位姿和空间约束;
- 资产、场景、传感器、策略、工具和软件版本;
- 智能体角色、任务分配、资源占用与协同关系;
- 物理状态、传感器状态、任务状态和评测状态;
- 运行快照、事件、工具结果、Critic 结论和错误;
- 成功、失败、恢复、人工介入和反事实分支。
Agent 通过受控读写操作更新世界状态。状态更新携带版本、来源和时间信息;冲突写入通过资源锁、条件更新或 Orchestrator 仲裁处理。集群因此围绕同一世界事实工作,避免多个角色各自推断出互相矛盾的场景。
5. MCP 工具契约
MCP 将资产检索、场景生成、PCG、3DGS、渲染、传感器、仿真运行、数据处理和评测能力暴露为结构化工具。每个工具声明:
- 名称、职责和适用角色;
- JSON Schema 输入与输出;
- 权限、资源和运行环境要求;
- 同步调用或异步任务语义;
- 超时、取消、幂等和重试规则;
- 状态、进度、结果和结构化错误;
- 运行轨迹、版本与审计信息。
轻量操作可由进程内工具执行,本地算力任务可进入 sidecar,长时或高负载任务可提交到远端队列。Agent 始终面向稳定工具契约工作,具体执行器通过适配层接入。
6. Visual、Physics 与 Safety Critics
Critic 的职责是检查和判定,而不是继续生成:
- Visual Critic检查对象是否出现、类别与外观是否匹配、空间关系是否符合任务、渲染和观测是否满足场景语义。
- Physics Critic检查穿透、悬空、支撑、碰撞、关节、质量、惯量、接触和运动结果是否物理可行。
- Safety Critic检查禁区、距离、权限、任务规则、资源限制、风险事件和停止条件。
Critic 输出通过、拒绝或修正请求,并附带问题对象、时间、证据、规则和建议动作。Orchestrator 根据结论选择修复、重跑、回滚、切换 Worker 或终止任务。
7. Simulator-in-the-loop 与事件调度
Agent 的计划必须进入仿真世界接受闭环验证。执行周期由以下环节组成:
观测世界 → 更新共享状态 → Planner 或策略决策 → Worker 调用工具或输出动作 → 仿真推进 → Critics 与真值判分 → 触发下一事件
事件调度器统一处理:
- 仿真时间、Agent 任务时间与外部消息时间;
- 传感器采样、策略决策、控制动作和环境响应;
- 工具完成、状态变化、Critic 结果和人工审批;
- 超时、故障、任务阶段切换、快照和终止;
- 多角色并行执行和同一资源上的冲突排序。
每个动作都绑定所读取的世界状态版本,防止 Agent 基于陈旧快照继续执行。
8. 可观测性、恢复与记忆
系统为每次运行建立统一 Trace,记录任务分解、Agent 决策、工具调用、参数、结果、世界状态变化、仿真事件、Critic 结论和恢复动作。
可观测性覆盖:
- Run、Stage、Agent、Tool、Simulation 与 Critic 层级的关联标识;
- 状态快照、事件时间轴、输入输出与版本;
- 延迟、资源、重试、错误和终止原因;
- 首次失败、首次状态分叉和受影响下游任务。
恢复策略按失败类型执行:
- 瞬时工具错误采用有界重试;
- Worker 不适配时切换角色或执行器;
- 局部产物不合格时回到最近检查点修正;
- 世界状态异常时恢复快照;
- 计划不可执行时由 Planner 重新分解;
- 安全约束触发时停止相关动作并保留现场证据。
记忆系统分为三层:
- 运行记忆保存本次任务的状态、事件和中间结果;
- 项目记忆保存客户术语、资产、规则、接口和评测口径;
- 经验记忆保存可复用的成功模式、失败模式、修复动作和工具选择。
写入长期记忆的内容必须经过结构化提取、来源关联和权限检查,避免把一次运行中的偶然描述直接固化为规则。
9. 闭环与反事实 rollout
闭环 rollout 记录智能体在动态环境中的连续观测、决策、动作和反馈。环境参与者会响应智能体行为,任务状态也随执行结果变化,因此能够评估单步输出之外的长期影响。
反事实 rollout 从同一快照创建分支,只改变指定变量:
- 替换策略、Planner、Orchestrator 或 Worker;
- 调整角色分工、协同关系和工具权限;
- 改变环境参与者意图、事件或物理参数;
- 注入传感器、通信、执行器或工具故障;
- 修改任务约束、资源限制或停止条件。
分支共享同一前序历史,系统比较任务结果、关键事件、角色轨迹、Critic 结论和真值指标。客户可以据此分析某个失败是否由策略、协同、工具、环境或物理执行引起。
10. 轨迹回收、后训练与部署适配
运行轨迹经过清洗、切分、标注和版本化后,可转换为:
- 成功任务、工具调用和角色协作示教;
- 同一状态下的成功与失败偏好对;
- 带 Critic 反馈和约束事件的过程监督数据;
- 失败动作、恢复动作与纠错轨迹;
- 固定场景、失败条件和指标组成的评测集;
- 观测、动作、反馈、终止和环境状态组成的策略数据。
部署适配层对齐仿真与真实系统的状态、动作、工具、模型和通信接口。策略或 Agent 版本更新后,先复用固定场景、失败索引和安全规则完成回归,再按部署协议交付。
运行闭环
一项客户任务按以下链路执行:
- 提交任务:输入业务目标、参考资料、场景资源、策略接口和验收要求。
- 编译规格:生成 Run Spec、场景图、角色图、工具清单、事件图和评测规则。
- 规划分工:Planner 拆解任务,Orchestrator 分配 Worker、依赖和资源。
- 初始化世界:加载资产、本体、环境、传感器、智能体和共享状态。
- 执行与检查:Worker 调用 MCP 工具,Visual、Physics、Safety Critics 检查阶段产物。
- 闭环运行:策略与 Agents 进入 simulator-in-the-loop,环境持续响应动作。
- 故障恢复:系统依据事件、错误和快照执行重试、替代、回滚或重新规划。
- 反事实比较:从关键快照运行不同策略、角色、事件和约束分支。
- 轨迹回收:整理成功、失败、恢复与分支轨迹,建立失败索引。
- 交付适配:输出评测证据、后训练数据和部署接口映射。
客户得到的交付物
场景包
场景包包含结构化任务、场景图、资产与版本清单、角色与协同关系、传感器配置、事件、约束、随机种子、工具契约、评测规则和停止条件,可直接用于复现和批量运行。
运行轨迹
运行轨迹保存世界状态、Agent 决策、工具调用、仿真反馈、Critic 结论、恢复动作、关键快照和终止原因。客户可以按 Run、Agent、工具、对象或事件查看完整执行链。
评测报告
评测报告覆盖任务结果、角色协同、工具执行、视觉一致性、物理可行性、安全约束、关键事件和版本差异,并关联对应轨迹与世界快照。
失败索引
失败索引按任务阶段、场景因子、角色、策略、工具、Critic、故障和根因标签组织。每个条目包含复现入口、关键时间窗、首次状态分叉、证据和相关版本。
后训练数据
后训练数据按用途交付示教轨迹、偏好对、过程监督、纠错数据、评测集和策略 rollout,并附带数据清单、来源、版本、质量结果和训练接口说明。
典型应用
- 自然语言场景编排:将业务描述编译为对象、关系、资产、物理和评测均可执行的场景。
- 多智能体任务预演:验证角色分工、资源竞争、通信、协同、故障转移和任务结果。
- 策略闭环评测:让决策或控制策略进入可响应动作的环境,检查长期行为与安全约束。
- 失败复现与反事实分析:从运行快照比较替代策略、角色配置、工具结果和环境响应。
- 数据生产自动化:由 Agents 组织场景、仿真、采集、质检、版本和分发任务。
- 后训练数据生成:把成功、失败、恢复和 Critic 反馈转化为可追溯的数据产品。
结语
仿真 Agent 集群的价值不在于角色数量,而在于把任务、状态、工具、物理世界、评测规则和学习反馈连接为可执行闭环。任务编译保证输入可验证,Planner 与 Orchestrator 保证协作可调度,MCP 保证工具可约束,Critics 与 simulator-in-the-loop 保证结果经过视觉、物理和安全检查,可观测性、恢复和记忆保证运行可追踪,rollout 回收则把每次执行转化为评测与后训练资产。
参考文档
- IAWG 世界生成器:结构化场景意图、资产匹配、物理稳定与 USD 输出
- 决策仿真平台:动态 AI 数字孪生、闭环评测与反事实 rollout
- SAGE,arXiv:2602.10116v2
- DriveArena: A Closed-loop Generative Simulation Platform for Autonomous Driving
- Real-is-Sim:动态数字孪生贯穿训练、评测与部署闭环的研究。
- RoaD:将仿真 rollout 整理为 demonstrations 并回流策略学习的研究。
- AI 模型后训练:从监督微调到 Agentic RL