Agent 工程

Physical AI 与仿真生成基础

按概念依赖关系整理 Physical AI、Embodied AI、仿真资产、targeted datasets、sim-to-real、机器人学习工具栈与 agent-guided generation 的基础知识。

本文整理的是 Physical AI 与机器人仿真生成领域的公开基础概念。内容采用通用工程语言,不包含任何特定企业、项目或个人的私有实现细节。

学习优先级地图

Physical AI 相关系统横跨机器人、三维资产、仿真、数据生成、模型训练和 agent 编排。较稳妥的概念顺序是先建立问题域,再理解仿真对象,随后进入数据与工具栈,最后回到 agent 如何把自然语言意图变成可执行生成计划。

优先级知识层核心问题对 agent 开发的关系
P0Physical AI 问题域机器如何在真实物理世界中感知、理解、决策并执行动作。意图分类、任务类型判断、需求缺口提问都依赖这层词汇。
P1Sim-ready asset一个三维模型怎样补齐几何、材质、碰撞体、物理参数和关节结构后进入仿真器。结构化 spec 中的字段大多围绕资产可仿真性展开。
P2数据与机器人学习synthetic data、targeted dataset、domain randomization、policy、RL 与 imitation learning 如何服务训练和评测。agent 生成的不只是外观描述,还包括数据目标、任务条件和评测约束。
P3仿真工具栈Isaac Sim、Isaac Lab、Newton、MuJoCo、Gazebo、Unreal、Genesis、OpenUSD 等组件各自处理什么问题。pipeline 参数、导出格式和验证规则经常与目标仿真器绑定。
P4Agent-guided generation自然语言、图像、CAD 或文档如何被规划器转换为 schema、queue graph 和流水线参数。agent 的核心职责是规划、澄清和校验,而不是直接执行重型仿真任务。

核心术语表

术语定义相关问题
Physical AI面向物理世界的 AI 系统,使自主机器能感知环境、理解状态并执行复杂动作。机器人、自动驾驶、无人机、工业自动化都属于典型场景。
Embodied AI具有“身体”或可行动载体的 AI。身体可以是真实机器人,也可以是仿真中的机器人形体。模型输出最终会受到传感器、执行器、动力学和环境约束限制。
Autonomous mobility自主移动能力,包括自动驾驶车辆、移动机器人、配送机器人和仓储机器人等。重点通常是定位、导航、避障、轨迹规划和安全验证。
Manipulation task机器人用机械臂、夹爪、手或工具改变物体状态的任务。抓取、推拉、开门、装配、穿线、折叠、倒液等都属于 manipulation。
Foundation model在大规模、多样数据上训练,可通过适配用于多种下游任务的通用模型。在机器人领域常扩展为视觉-语言-动作模型或 robot foundation model。
World foundation model学习世界状态、物理关系、动作后果或场景演化规律的模型类别。常用于生成、预测或评估物理环境中的时空变化。
Targeted dataset围绕特定任务、物体、环境、传感器或失败模式构造的数据集。其价值不只在规模,而在覆盖目标场景的关键变化。
Synthetic data由仿真、渲染或生成系统生产的数据,而非直接来自真实采集。常用于扩充稀缺场景、控制标签、生成边界条件和降低真实采集成本。
Simulation用软件系统近似物体、机器人、传感器、控制和环境交互的过程。仿真质量由几何、物理、传感器、任务逻辑和随机化共同决定。
Sim-ready asset可直接进入仿真器的资产,不只是可看的三维模型。通常包含单位、坐标、材质、碰撞、质量、惯性、关节、约束和元数据。
Real-to-sim把真实世界的观测、CAD、视频、图像或测量数据转换为仿真表示。目标是让仿真对象与真实对象在外观、结构或行为上足够接近。
Sim-to-real gap仿真训练或评测结果迁移到真实世界时出现的差异。差异来源包括接触物理、摩擦、传感器噪声、材质、控制延迟和环境分布。
Domain randomization在仿真中随机化材质、光照、位置、质量、摩擦、背景或传感器噪声。目标是让模型见到足够多变化,从而提高对真实世界变化的鲁棒性。
Policy机器人从观测到动作的映射函数。可以由规则、传统控制、强化学习、模仿学习或 foundation model 产生。
Reinforcement learning通过奖励信号学习动作策略的方法。仿真可提供大量可重置、可并行、低风险的试错环境。
Imitation learning从示范数据中学习行为策略的方法。示范可以来自人类遥操作、真实机器人轨迹、视频或仿真轨迹。
Digital twin真实系统在数字空间中的可计算表示。用于可视化、监控、预测、测试和仿真,不等同于普通 3D 展示。
Agentic pipeline由 agent 进行规划、澄清、参数化和状态流转的流水线。模型通常负责编排和决策,重型计算由专门后端任务执行。
Robot sensor bitstream机器人传感器产生的连续数据流,例如相机、LiDAR、IMU、触觉和关节状态。仿真系统若要替代真实采集,常需生成与传感器接口兼容的数据。

仿真资产生成链路

面向机器人训练或评测的资产生成不是普通 3D 建模。可视外观只是其中一层,仿真器还需要碰撞、质量、惯性、关节、约束和验证信息。

输入层定义资产来源和目标:自然语言适合表达意图,图像适合提供外观线索,CAD 适合提供工程几何,datasheet 适合补充尺寸、材料和运动约束。
Mesh由顶点、边和面组成的三维几何表面。
Texture / Material描述颜色、粗糙度、金属度、法线和透明度等外观属性。
Collision物理引擎用于接触计算的简化几何,通常不同于高精渲染 mesh。
Rigid body形状不发生明显形变的物体,常见于箱子、工具、家具和机械零件。
Soft body会发生形变的对象,例如布料、线缆、橡胶件或软包装。
Articulation带有关节、连杆和运动限制的结构,例如门铰链、抽屉滑轨或机器人手。

数据、训练与评测

Physical AI 的数据问题通常不是“更多图片”这么简单。机器人学习需要覆盖物体状态、接触条件、动作序列、传感器噪声和失败模式。仿真系统的价值在于可以受控地产生这些组合。

概念作用典型变量
Targeted dataset聚焦某类物体、环境或失败模式,补足真实数据难以覆盖的区域。物体类别、尺寸、姿态、遮挡、材质、传感器视角。
Synthetic dataset从仿真或生成系统批量产生带标签数据。RGB、depth、segmentation、normal、pose、轨迹和接触事件。
RL environment提供状态、动作、奖励、终止条件和重置逻辑。任务目标、奖励函数、约束、随机化范围和并行环境数。
Evaluation environment用可重复场景衡量策略或模型表现。成功率、碰撞率、完成时间、能耗、失败类别。
Real-to-sim tuning用真实观测校准仿真中的物理或传感器参数。摩擦、恢复系数、质量、阻尼、控制延迟、噪声模型。

仿真工具与组件

仿真生态中没有单一工具覆盖所有需求。不同组件分别偏向机器人仿真、物理引擎、学习框架、场景交换格式、可视化或数字孪生。

组件定位常见用途
NVIDIA Isaac Sim基于 Omniverse / OpenUSD 的机器人仿真、测试和 synthetic data 生成框架。机器人场景、传感器仿真、数据生成、测试验证。
NVIDIA Isaac Lab面向机器人学习的开源、模块化、GPU 加速框架。强化学习、模仿学习、policy 训练和仿真评测。
NVIDIA Newton由 NVIDIA、Google DeepMind 与 Disney Research 开发的开源可扩展物理引擎,建立在 Warp 和 OpenUSD 之上。接触丰富的机器人学习、仿真物理、可微或 GPU 加速物理研究。
MuJoCoMulti-Joint dynamics with Contact,面向机器人、控制、机器学习等领域的通用物理引擎。机器人控制、接触动力学、RL benchmark、快速物理实验。
Gazebo Sim开源机器人仿真器,提供物理、渲染、传感器模型、GUI、插件和消息接口。ROS 生态中的机器人仿真、传感器测试和系统集成。
PyBullet / Bullet实时物理仿真库及其 Python 接口。轻量机器人仿真、碰撞检测、RL 实验和快速原型。
Unreal Engine实时三维引擎,常用于高保真可视化和 digital twin。复杂场景可视化、传感器视觉环境、数字孪生展示。
Genesis WorldPhysical AI simulation platform,结合多物理引擎、渲染器和 Pythonic simulation interface。研究代码中的机器人与物理仿真、可扩展仿真实验。
OpenUSD用于描述、组合和仿真 3D 世界的开放、可扩展框架。场景交换、资产组合、层级编辑、仿真器之间的数据表示。

Agent 开发视角

Agent-guided generation 中的 LLM 更接近规划器,而不是仿真执行器。它把非结构化输入转成可校验的结构化计划,再交给后端 pipeline 执行。

  1. 输入理解:解析自然语言、图像、CAD、datasheet 或当前场景上下文。
  2. 意图分类:区分 text-to-asset、image-to-asset、CAD import、scene generation、asset refinement 等任务。
  3. 结构化 spec:把用户意图转成 schema,包括资产类型、形状、材质、尺寸、物理属性、关节、输出格式和参考资源。
  4. 需求缺口:识别缺少的关键信息,例如尺寸单位、运动范围、目标仿真器、碰撞精度或参考图选择。
  5. 队列参数:将 spec 映射成 pipeline 可消费的参数,而不是让模型直接运行重型生成任务。
  6. 可观测性:保留 trace、warnings、questions、actions 和 queue graph,使失败能被定位和复现。
在这类系统中,prompt、schema、validator、fallback、requirement gaps 和 queue-param mapping 的工程质量,通常决定 agent 是否能稳定连接自然语言和仿真流水线。

常见误解

参考与说明

本文面向公开知识整理,组件状态与产品能力可能随时间变化。涉及具体版本、API 和部署方式时,官方文档是更合适的事实来源。