本文整理的是 Physical AI 与机器人仿真生成领域的公开基础概念。内容采用通用工程语言,不包含任何特定企业、项目或个人的私有实现细节。
学习优先级地图
Physical AI 相关系统横跨机器人、三维资产、仿真、数据生成、模型训练和 agent 编排。较稳妥的概念顺序是先建立问题域,再理解仿真对象,随后进入数据与工具栈,最后回到 agent 如何把自然语言意图变成可执行生成计划。
| 优先级 | 知识层 | 核心问题 | 对 agent 开发的关系 |
|---|---|---|---|
| P0 | Physical AI 问题域 | 机器如何在真实物理世界中感知、理解、决策并执行动作。 | 意图分类、任务类型判断、需求缺口提问都依赖这层词汇。 |
| P1 | Sim-ready asset | 一个三维模型怎样补齐几何、材质、碰撞体、物理参数和关节结构后进入仿真器。 | 结构化 spec 中的字段大多围绕资产可仿真性展开。 |
| P2 | 数据与机器人学习 | synthetic data、targeted dataset、domain randomization、policy、RL 与 imitation learning 如何服务训练和评测。 | agent 生成的不只是外观描述,还包括数据目标、任务条件和评测约束。 |
| P3 | 仿真工具栈 | Isaac Sim、Isaac Lab、Newton、MuJoCo、Gazebo、Unreal、Genesis、OpenUSD 等组件各自处理什么问题。 | pipeline 参数、导出格式和验证规则经常与目标仿真器绑定。 |
| P4 | Agent-guided generation | 自然语言、图像、CAD 或文档如何被规划器转换为 schema、queue graph 和流水线参数。 | agent 的核心职责是规划、澄清和校验,而不是直接执行重型仿真任务。 |
核心术语表
| 术语 | 定义 | 相关问题 |
|---|---|---|
| Physical AI | 面向物理世界的 AI 系统,使自主机器能感知环境、理解状态并执行复杂动作。 | 机器人、自动驾驶、无人机、工业自动化都属于典型场景。 |
| Embodied AI | 具有“身体”或可行动载体的 AI。身体可以是真实机器人,也可以是仿真中的机器人形体。 | 模型输出最终会受到传感器、执行器、动力学和环境约束限制。 |
| Autonomous mobility | 自主移动能力,包括自动驾驶车辆、移动机器人、配送机器人和仓储机器人等。 | 重点通常是定位、导航、避障、轨迹规划和安全验证。 |
| Manipulation task | 机器人用机械臂、夹爪、手或工具改变物体状态的任务。 | 抓取、推拉、开门、装配、穿线、折叠、倒液等都属于 manipulation。 |
| Foundation model | 在大规模、多样数据上训练,可通过适配用于多种下游任务的通用模型。 | 在机器人领域常扩展为视觉-语言-动作模型或 robot foundation model。 |
| World foundation model | 学习世界状态、物理关系、动作后果或场景演化规律的模型类别。 | 常用于生成、预测或评估物理环境中的时空变化。 |
| Targeted dataset | 围绕特定任务、物体、环境、传感器或失败模式构造的数据集。 | 其价值不只在规模,而在覆盖目标场景的关键变化。 |
| Synthetic data | 由仿真、渲染或生成系统生产的数据,而非直接来自真实采集。 | 常用于扩充稀缺场景、控制标签、生成边界条件和降低真实采集成本。 |
| Simulation | 用软件系统近似物体、机器人、传感器、控制和环境交互的过程。 | 仿真质量由几何、物理、传感器、任务逻辑和随机化共同决定。 |
| Sim-ready asset | 可直接进入仿真器的资产,不只是可看的三维模型。 | 通常包含单位、坐标、材质、碰撞、质量、惯性、关节、约束和元数据。 |
| Real-to-sim | 把真实世界的观测、CAD、视频、图像或测量数据转换为仿真表示。 | 目标是让仿真对象与真实对象在外观、结构或行为上足够接近。 |
| Sim-to-real gap | 仿真训练或评测结果迁移到真实世界时出现的差异。 | 差异来源包括接触物理、摩擦、传感器噪声、材质、控制延迟和环境分布。 |
| Domain randomization | 在仿真中随机化材质、光照、位置、质量、摩擦、背景或传感器噪声。 | 目标是让模型见到足够多变化,从而提高对真实世界变化的鲁棒性。 |
| Policy | 机器人从观测到动作的映射函数。 | 可以由规则、传统控制、强化学习、模仿学习或 foundation model 产生。 |
| Reinforcement learning | 通过奖励信号学习动作策略的方法。 | 仿真可提供大量可重置、可并行、低风险的试错环境。 |
| Imitation learning | 从示范数据中学习行为策略的方法。 | 示范可以来自人类遥操作、真实机器人轨迹、视频或仿真轨迹。 |
| Digital twin | 真实系统在数字空间中的可计算表示。 | 用于可视化、监控、预测、测试和仿真,不等同于普通 3D 展示。 |
| Agentic pipeline | 由 agent 进行规划、澄清、参数化和状态流转的流水线。 | 模型通常负责编排和决策,重型计算由专门后端任务执行。 |
| Robot sensor bitstream | 机器人传感器产生的连续数据流,例如相机、LiDAR、IMU、触觉和关节状态。 | 仿真系统若要替代真实采集,常需生成与传感器接口兼容的数据。 |
仿真资产生成链路
面向机器人训练或评测的资产生成不是普通 3D 建模。可视外观只是其中一层,仿真器还需要碰撞、质量、惯性、关节、约束和验证信息。
输入层定义资产来源和目标:自然语言适合表达意图,图像适合提供外观线索,CAD 适合提供工程几何,datasheet 适合补充尺寸、材料和运动约束。
Mesh由顶点、边和面组成的三维几何表面。
Texture / Material描述颜色、粗糙度、金属度、法线和透明度等外观属性。
Collision物理引擎用于接触计算的简化几何,通常不同于高精渲染 mesh。
Rigid body形状不发生明显形变的物体,常见于箱子、工具、家具和机械零件。
Soft body会发生形变的对象,例如布料、线缆、橡胶件或软包装。
Articulation带有关节、连杆和运动限制的结构,例如门铰链、抽屉滑轨或机器人手。
数据、训练与评测
Physical AI 的数据问题通常不是“更多图片”这么简单。机器人学习需要覆盖物体状态、接触条件、动作序列、传感器噪声和失败模式。仿真系统的价值在于可以受控地产生这些组合。
| 概念 | 作用 | 典型变量 |
|---|---|---|
| Targeted dataset | 聚焦某类物体、环境或失败模式,补足真实数据难以覆盖的区域。 | 物体类别、尺寸、姿态、遮挡、材质、传感器视角。 |
| Synthetic dataset | 从仿真或生成系统批量产生带标签数据。 | RGB、depth、segmentation、normal、pose、轨迹和接触事件。 |
| RL environment | 提供状态、动作、奖励、终止条件和重置逻辑。 | 任务目标、奖励函数、约束、随机化范围和并行环境数。 |
| Evaluation environment | 用可重复场景衡量策略或模型表现。 | 成功率、碰撞率、完成时间、能耗、失败类别。 |
| Real-to-sim tuning | 用真实观测校准仿真中的物理或传感器参数。 | 摩擦、恢复系数、质量、阻尼、控制延迟、噪声模型。 |
仿真工具与组件
仿真生态中没有单一工具覆盖所有需求。不同组件分别偏向机器人仿真、物理引擎、学习框架、场景交换格式、可视化或数字孪生。
| 组件 | 定位 | 常见用途 |
|---|---|---|
| NVIDIA Isaac Sim | 基于 Omniverse / OpenUSD 的机器人仿真、测试和 synthetic data 生成框架。 | 机器人场景、传感器仿真、数据生成、测试验证。 |
| NVIDIA Isaac Lab | 面向机器人学习的开源、模块化、GPU 加速框架。 | 强化学习、模仿学习、policy 训练和仿真评测。 |
| NVIDIA Newton | 由 NVIDIA、Google DeepMind 与 Disney Research 开发的开源可扩展物理引擎,建立在 Warp 和 OpenUSD 之上。 | 接触丰富的机器人学习、仿真物理、可微或 GPU 加速物理研究。 |
| MuJoCo | Multi-Joint dynamics with Contact,面向机器人、控制、机器学习等领域的通用物理引擎。 | 机器人控制、接触动力学、RL benchmark、快速物理实验。 |
| Gazebo Sim | 开源机器人仿真器,提供物理、渲染、传感器模型、GUI、插件和消息接口。 | ROS 生态中的机器人仿真、传感器测试和系统集成。 |
| PyBullet / Bullet | 实时物理仿真库及其 Python 接口。 | 轻量机器人仿真、碰撞检测、RL 实验和快速原型。 |
| Unreal Engine | 实时三维引擎,常用于高保真可视化和 digital twin。 | 复杂场景可视化、传感器视觉环境、数字孪生展示。 |
| Genesis World | Physical AI simulation platform,结合多物理引擎、渲染器和 Pythonic simulation interface。 | 研究代码中的机器人与物理仿真、可扩展仿真实验。 |
| OpenUSD | 用于描述、组合和仿真 3D 世界的开放、可扩展框架。 | 场景交换、资产组合、层级编辑、仿真器之间的数据表示。 |
Agent 开发视角
Agent-guided generation 中的 LLM 更接近规划器,而不是仿真执行器。它把非结构化输入转成可校验的结构化计划,再交给后端 pipeline 执行。
- 输入理解:解析自然语言、图像、CAD、datasheet 或当前场景上下文。
- 意图分类:区分 text-to-asset、image-to-asset、CAD import、scene generation、asset refinement 等任务。
- 结构化 spec:把用户意图转成 schema,包括资产类型、形状、材质、尺寸、物理属性、关节、输出格式和参考资源。
- 需求缺口:识别缺少的关键信息,例如尺寸单位、运动范围、目标仿真器、碰撞精度或参考图选择。
- 队列参数:将 spec 映射成 pipeline 可消费的参数,而不是让模型直接运行重型生成任务。
- 可观测性:保留 trace、warnings、questions、actions 和 queue graph,使失败能被定位和复现。
在这类系统中,prompt、schema、validator、fallback、requirement gaps 和 queue-param mapping 的工程质量,通常决定 agent 是否能稳定连接自然语言和仿真流水线。
常见误解
- 仿真资产不等于漂亮模型。 视觉外观不足以支持物理接触、传感器生成、机器人控制和评测。
- 照片级真实不等于物理真实。 机器人任务中,摩擦、质量、惯性、关节限制和接触稳定性可能比外观更影响结果。
- Targeted dataset 不只是大数据集。 目标场景、边界条件和失败模式覆盖度往往比总样本数更有解释力。
- Foundation model 不是完整机器人系统。 真实部署还依赖传感器、控制、安全约束、环境建模和硬件接口。
- Agent 不宜承担所有计算。 LLM 适合规划、澄清、校验和编排,重型仿真与生成任务通常由专门 pipeline 执行。
参考与说明
- NVIDIA Glossary: What is Physical AI?
- NVIDIA Developer: Isaac Sim, Isaac Lab, Newton Physics Engine, OpenUSD for Developers
- Isaac Sim Documentation: Synthetic Data Generation
- MuJoCo Documentation: MuJoCo Overview
- Gazebo Documentation: Gazebo Sim
- Unreal Engine: Digital Twins
- Genesis World Documentation: Genesis World
本文面向公开知识整理,组件状态与产品能力可能随时间变化。涉及具体版本、API 和部署方式时,官方文档是更合适的事实来源。