Cosmos 3 技术报告全文中文译稿:面向物理 AI 的全模态世界模型

前言

NVIDIA 于 2026-06-22 发布 Cosmos 3 技术报告——一族全模态(omnimodal)世界模型,在统一的 Mixture-of-Transformers(MoT)架构中联合处理并生成语言、图像、视频、音频与动作序列,把视觉-语言模型、视频生成器、世界模拟器与世界-动作模型收进同一个框架。发布时,其后训练模型被 Artificial Analysis 评为最佳开源文生图与图生视频模型,被 RoboArena 评为最佳策略模型。代码、权重、数据集与基准以 Linux Foundation OpenMDW-1.1 许可全部开源。

原报告 139 页,本站提供全文中文译稿(Claude 翻译,完整保留原文结构与全部 37 张图表;附录 G 与参考文献不译):

内容速览

全文共 8 章 + 6 个附录:引言 / 模型架构 / 数据 / 训练 / 基础设施 / 实验结果 / 相关工作 / 结论,附录覆盖 caption schema、提示词模板全集、合成数据集、Edge LLM 训练、补充消融与 Cosmos-HUE 基准。

几个值得先看的点:

  1. 统一架构:Reasoner(理解面)+ Generator(生成面)共享一个 MoT 骨干,输入输出配置高度灵活,一套权重覆盖 VLM、T2I、I2V、世界模拟与动作策略。
  2. 训练课程:预训练用 1024–4096 块 GB200、数十万亿词元;视频迁移(video transfer,4M 样本)出现在中期训练——官方没有 transfer 专科后训练配方,in-context 结构控制是 base 能力。
  3. 工程可复用产物:表 21 给出各控制模态的官方推理参数(steps / guidance / control_guidance / flow_shift);附录 B 提供 Reasoner 上采样、I2V 两阶段、视频迁移系统前缀与约 4 页结构化负面提示词的完整模板。
  4. 表 26 负结果:纯合成数据单独微调无法提升生成模型的 T2V 质量——做合成数据的团队值得把这条消融记在心上。

译者解读

译稿末章附**「译者解读:对 IMS/DMS 合成数据管线意味着什么」**(非原文内容),按”边界 → 产物 → 裂缝 → 增量 → 路线 → 前提”六段,评估了从 Cosmos-Transfer2.5 迁移到 Cosmos 3 的实际价值与未知数,供做座舱合成数据方向的同行参考。

原报告版权 © 2026 NVIDIA,以 OpenMDW-1.1 许可开源发布;译稿供研究学习使用。项目主页:research.nvidia.com/labs/cosmos-lab/cosmos3


Cosmos 3 技术报告全文中文译稿:面向物理 AI 的全模态世界模型
https://dapalm.com/2026/07/19/2026-07-19-Cosmos3技术报告全文中文译稿/
作者
Mars
发布于
2026年7月19日
许可协议