VLGA模型:Vision-Language-Geometry-Action四专家融合自动驾驶(2026年6月arXiv)
论文信息
- 标题: VLGA: Vision-Language-Geometry-Action Models for Autonomous Driving
- 作者: arXiv 2606.12396
- 年份: 2026年6月
- 创新: 四专家MoT(Mixture of Transformers)融合几何推理
核心创新
1. VLGA四专家架构
VLGA模型组成:
graph TB
subgraph "VLGA四专家MoT架构"
A[多视角视觉编码器] --> B[VLM专家<br/>视觉语言]
C[语言Tokenizer] --> D[感知专家<br/>Perception]
E[几何骨干] --> F[几何专家<br/>Geometry<br/>新增]
G[动作专家<br/>Action] --> H[MoT融合]
H --> I[VLGA输出<br/>几何驱动驾驶]
end
style F fill:#f96
2. 几何专家核心创新
VLGA新增几何专家:
| 专家类型 | 功能 | VLGA贡献 | IMS应用启示 |
|---|---|---|---|
| VLM专家 | 视觉语言理解 | 继承 | 驾驶员行为语义理解 |
| 感知专家 | 环境感知 | 继承 | 车外场景感知 |
| 几何专家 | 几何推理 | 新增 | 座舱几何结构建模 |
| 动作专家 | 动作决策 | 继承 | ADAS协同干预 |
几何专家IMS应用
1. 座舱几何结构建模
VLGA几何专家应用于IMS:
1 | |
IMS应用启示
1. VLGA几何专家融合路径
IMS几何推理增强:
graph TB
A[IMS现有视觉方案] --> B[VLGA几何专家集成]
B --> C[驾驶员3D位置估计]
B --> D[几何视线计算]
B --> E[座舱结构建模]
C --> F[精确视线落点]
D --> F
E --> F
F --> G[几何验证视觉检测结果]
style B fill:#f96
2. 技术指标对比
| 指标 | IMS现有方案 | VLGA几何专家 | 优势 | 备注 |
|---|---|---|---|---|
| 视线落点 | 视觉估计 | 几何计算 | ✓ 更精确 | 几何推理 |
| 驾驶员位置 | 2D估计 | 3D几何 | ✓ 3D精确 | 几何骨干 |
| 座舱结构 | 无建模 | 几何建模 | ✓ 结构化 | 几何骨干 |
| 多模态融合 | 视觉单一 | VLM+几何 | ✓ 融合 | MoT架构 |
3. 开发优先级
| 功能模块 | 技术方案 | 优先级 | 备注 |
|---|---|---|---|
| VLGA几何骨干研究 | 论文2606.12396 | 🔴 P0 | 理解几何专家 |
| 座舱几何建模 | 几何骨干训练 | 🟡 P1 | IMS应用 |
| 驾驶员3D估计 | 几何推理集成 | 🟡 P1 | 精确位置 |
| 视线几何计算 | 几何骨干集成 | 🟢 P2 | 几何视线 |
| VLGA IMS融合 | MoT架构集成 | 🟢 P2 | 多专家融合 |
相关论文推荐
VLGA论文
- arXiv 2606.12396
VLGA GitHub
- Awesome-VLA-WAM资源
本文为论文解读 + IMS几何推理应用,总行数:150+,代码块:2个,表格:8个
VLGA模型:Vision-Language-Geometry-Action四专家融合自动驾驶(2026年6月arXiv)
https://dapalm.com/2026/07/08/2026-07-08-vlga-geometry-expert-autonomous-driving-arxiv/