Smart Eye 多模态座舱 AI Agent:从感知到行动的座舱智能体跃迁(InCabin 2026 深度解析)

Smart Eye 多模态座舱 AI Agent:从感知到行动的座舱智能体跃迁

1. 发布概述

1.1 基本信息

项目 内容
发布方 Smart Eye AB(瑞典哥德堡)
发布时间 2026年9月23日
展示场所 InCabin Europe 2026,巴塞罗那,9月22-24日,展位 #305
定位 全球首个多模态座舱 AI Agent
核心能力 融合人类+车辆+环境上下文,减少 AI Agent 计算开销

1.2 核心声明

“Automotive agents become economically viable when the value they create outweighs the cost and complexity of running them. Our agnostic platform is the first to combine human, cabin, vehicle and environmental context for automotive agentic AI. We believe this multimodal approach can bring the technology into production much sooner.”

— Martin Krantz, CEO and Founder, Smart Eye

1.3 为什么重要

座舱 AI Agent 的核心挑战不是”能不能做”,而是**”能不能在车规级算力上经济地运行”**。Smart Eye 的方案通过多模态上下文富化输入,减少 Agent 达成目标所需的推理步数和计算量。


2. 技术架构分析

2.1 多模态输入层

graph TD
    subgraph "人类上下文"
        A1[语音输入]
        A2[驾驶员身份]
        A3[视线方向]
        A4[注意力状态]
        A5[情绪状态]
        A6[驾驶员状态<br/>疲劳/分心/损伤]
        A7[乘员占用]
    end
    
    subgraph "车辆上下文"
        B1[ADAS 状态]
        B2[车辆动力学]
        B3[座舱环境<br/>温度/湿度]
        B4[仪表/HMI 状态]
        B5[座椅/方向盘位置]
    end
    
    subgraph "环境上下文"
        C1[外部感知<br/>摄像头/雷达]
        C2[导航/地图]
        C3[天气/光照]
        C4[交通状态]
    end
    
    subgraph "Agent 核心引擎"
        D1[上下文融合层]
        D2[意图理解]
        D3[决策规划]
        D4[行动执行]
    end
    
    A1 & A2 & A3 & A4 & A5 & A6 & A7 --> D1
    B1 & B2 & B3 & B4 & B5 --> D1
    C1 & C2 & C3 & C4 --> D1
    
    D1 --> D2 --> D3 --> D4
    
    D4 --> E1[车内功能控制]
    D4 --> E2[仪表盘 Widget 生成]
    D4 --> E3[外部 ADAS 联动]
    D4 --> E4[语音回复]

2.2 核心创新:上下文富化降低计算开销

传统 AI Agent 的工作流程:

1
2
用户语音 → STT → LLM 理解 → LLM 规划 → LLM 执行 → 结果
(每步消耗大量 token 和算力)

Smart Eye 多模态 Agent 的工作流程:

1
2
3
4
5
用户语音 + 视线 + 情绪 + 车辆状态 + 环境 → 上下文融合
→ 精简意图(已含丰富上下文)
→ 小模型快速决策
→ 直接执行
(减少 LLM 推理步数和 token 消耗)

2.3 关键能力

能力 描述 示例
视线指代消解 结合视线方向和外部感知理解驾驶员指向 驾驶员看窗外建筑并说”那个” → Agent 识别建筑并查询信息
动态 Widget 生成 根据实时驾驶员/座舱数据创建仪表盘组件 检测到疲劳 → 生成最近休息站 Widget
车辆功能控制 通过自然语言控制车内功能 “我有点冷” → 调整空调温度(结合体温/情绪判断)
多模态意图理解 融合语音+视线+情绪理解真实意图 语音”没事” + 疲劳状态 → 触发休息建议

3. 与 Lynk & Co Z20 事故的关联

3.1 事故回顾

2026年3月,一辆 Lynk & Co Z20 在中国高速公路上行驶时,车内语音助手误识别了一条语音指令,意外关闭了前大灯,导致车辆撞上中央隔离带。

3.2 事故根因分析

问题层 描述 Smart Eye 方案如何避免
单模态理解 仅有语音输入,缺少上下文验证 多模态融合:语音+视线+车辆状态
无安全约束 语音指令直接执行,无场景校验 Agent 决策层:高速行驶时拒绝危险操作
无意图消解 “关灯”指令无上下文确认 视线+场景:高速行驶+夜间 → 拒绝关灯
无驾驶员状态 不知道驾驶员是否分心 驾驶员状态:注意力是否集中

3.3 安全架构对比

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
"""
座舱 AI Agent 安全决策框架
对比单模态 vs 多模态安全策略
"""

from dataclasses import dataclass
from enum import Enum
from typing import Optional

class RiskLevel(Enum):
SAFE = 0
LOW_RISK = 1
MEDIUM_RISK = 2
HIGH_RISK = 3
CRITICAL = 4

@dataclass
class VehicleContext:
speed_kmh: float
time_of_day: str # 'day' | 'night' | 'dawn' | 'dusk'
road_type: str # 'highway' | 'urban' | 'parking' | 'rural'
weather: str # 'clear' | 'rain' | 'fog' | 'snow'

@dataclass
class DriverContext:
attention_level: float # 0-1
gaze_target: str # 'road' | 'mirror' | 'infotainment' | 'outside_left' | 'outside_right'
voice_command: str
voice_confidence: float
emotion: str # 'neutral' | 'happy' | 'angry' | 'tired' | 'distracted'

class SafetyGatekeeper:
"""
AI Agent 安全门控:在执行前评估风险

核心原则:高速行驶 + 危险操作 = 拒绝
"""

DANGEROUS_COMMANDS = [
'turn_off_headlights',
'open_door',
'fold_mirror',
'disable_adas',
'change_drive_mode',
]

def evaluate(self, driver: DriverContext, vehicle: VehicleContext) -> tuple:
"""
评估操作风险

Returns:
(RiskLevel, should_execute, reason)
"""
risk = RiskLevel.SAFE

# 基于车辆状态的风险评估
if vehicle.speed_kmh > 60:
risk = RiskLevel(risk.value + 1)
if vehicle.time_of_day == 'night':
risk = RiskLevel(risk.value + 1)
if vehicle.road_type == 'highway':
risk = RiskLevel(risk.value + 1)

# 基于驾驶员状态的风险评估
if driver.attention_level < 0.5:
risk = RiskLevel(risk.value + 1)
if driver.voice_confidence < 0.8:
risk = RiskLevel(risk.value + 1)

# 危险命令检查
is_dangerous = any(cmd in driver.voice_command for cmd in self.DANGEROUS_COMMANDS)
if is_dangerous:
risk = RiskLevel(risk.value + 2)

# 执行决策
if risk.value >= RiskLevel.HIGH_RISK.value:
return (risk, False, "操作风险过高,已拒绝执行")
elif risk.value >= RiskLevel.MEDIUM_RISK.value:
return (risk, False, "请确认操作意图")
else:
return (risk, True, "操作安全,执行中")

def safe_execute(self, driver: DriverContext, vehicle: VehicleContext) -> dict:
"""
安全执行流程
"""
risk, should_exec, reason = self.evaluate(driver, vehicle)

if not should_exec:
# 拒绝时的多模态反馈
response = {
'action': 'reject',
'reason': reason,
'risk_level': risk.name,
'voice_feedback': self._generate_feedback(driver, vehicle, reason),
'visual_alert': True if risk.value >= 3 else False,
'haptic_feedback': True if risk.value >= 4 else False
}
return response

return {
'action': 'execute',
'risk_level': risk.name,
'reason': reason
}

def _generate_feedback(self, driver, vehicle, reason):
"""生成自然语言反馈"""
if 'headlight' in driver.voice_command and vehicle.time_of_day == 'night':
return "夜间高速行驶中,关闭前大灯存在安全风险,操作已拒绝。如需调整灯光,请停车后操作。"
return f"当前场景下操作存在风险:{reason}。请在安全停车后重试。"


# 测试:模拟 Lynk & Co Z20 事故场景
if __name__ == "__main__":
gatekeeper = SafetyGatekeeper()

# 事故场景:夜间高速 + 语音"关灯"
accident_driver = DriverContext(
attention_level=0.7,
gaze_target='road',
voice_command='turn_off_headlights',
voice_confidence=0.75, # 不太确信
emotion='neutral'
)

accident_vehicle = VehicleContext(
speed_kmh=110, # 高速
time_of_day='night',
road_type='highway',
weather='clear'
)

result = gatekeeper.safe_execute(accident_driver, accident_vehicle)
print("=== 事故场景(单模态会执行,多模态拒绝)===")
print(f"风险等级: {result['risk_level']}")
print(f"执行决策: {result['action']}")
print(f"原因: {result['reason']}")
if 'voice_feedback' in result:
print(f"语音反馈: {result['voice_feedback']}")

# 正常场景:停车场 + 白天 + 语音"关灯"
normal_driver = DriverContext(
attention_level=0.9,
gaze_target='road',
voice_command='turn_off_headlights',
voice_confidence=0.95,
emotion='neutral'
)

normal_vehicle = VehicleContext(
speed_kmh=0,
time_of_day='day',
road_type='parking',
weather='clear'
)

result = gatekeeper.safe_execute(normal_driver, normal_vehicle)
print("\n=== 正常场景(停车场白天)===")
print(f"风险等级: {result['risk_level']}")
print(f"执行决策: {result['action']}")
print(f"原因: {result['reason']}")

4. 行业影响分析

4.1 座舱智能体竞争格局

企业 方案 多模态 Agent 能力 量产状态
Smart Eye 多模态 AI Agent ✅ 人类+车辆+环境 ✅ 决策+执行 演示阶段
Minieye DFR + AI Cabin Butler ⚠️ 人类为主 ⚠️ 有限 2026 发布
Cerence Cerence ChatLux ⚠️ 语音为主 ✅ 对话 部分量产
SoundHound Houndify ⚠️ 语音为主 ✅ 对话 量产
** Honor/华为** HiCar ⚠️ 语音为主 ⚠️ 有限 量产

Smart Eye 的差异化在于以视觉感知为核心的多模态融合,而非纯粹的语音助手。

4.2 座舱 AI Agent 的三个阶段

阶段 能力 时间 代表
Stage 1: 语音助手 语音命令执行 2020-2025 Cerence, SoundHound
Stage 2: 多模态 Agent 语音+视觉+车辆状态融合决策 2026-2028 Smart Eye, Minieye
Stage 3: 自主智能体 主动预测+自主行动+学习 2029+ TBD

4.3 对算力的影响

Smart Eye 声称多模态上下文可以减少 Agent 计算开销:

方案 LLM 调用次数 Token 消耗 延迟 车规级可行性
纯语音 Agent 5-10 步推理 高(10K+ tokens) 3-8s ❌ 需云端
多模态 Agent 1-3 步推理 低(2K tokens) 0.5-2s ✅ 边缘可行

5. 对 IMS 开发的启示

5.1 可落地的开发建议

优先级 建议 具体行动
🔴 P0 座舱 Agent 安全门控 所有语音命令在执行前经过车辆状态+驾驶员状态+环境评估
🔴 P0 视线指代消解 结合视线方向和外部摄像头识别驾驶员指向的物体
🟡 P1 动态 Widget 生成 检测到特定状态时自动生成 HMI 组件(疲劳→休息站 Widget)
🟡 P1 多模态意图理解 语音+情绪+注意力综合判断,而非纯语音
🟢 P2 边缘 LLM 部署 评估 7B 参数 LLM 在 QCS8255 上的推理性能

5.2 Agent 架构建议

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
IMS Agent 架构:

1. 感知层(已有)
├── DMS 摄像头 → 眼动/面部/姿态
├── OMS 摄像头 → 乘员/安全带
├── 雷达模块 → CPD/生命体征
└── 车辆 CAN → 速度/方向盘/ADAS

2. 上下文融合层(新增)
├── 驾驶员状态综合评估
├── 车辆状态监控
└── 环境感知融合

3. Agent 决策层(新增)
├── 意图理解(语音+多模态)
├── 安全评估(门控)
└── 执行规划

4. 执行层
├── 车辆功能控制(CAN)
├── HMI Widget 生成
├── 语音回复
└── ADAS 联动

6. 技术路线判断

6.1 核心洞察

Smart Eye 的多模态 Agent 方案揭示了座舱智能的三个趋势:

  1. 从语音助手到智能体:座舱 AI 不再只是”执行命令”,而是”理解意图并自主决策”
  2. 多模态降低算力需求:上下文富化是让边缘 LLM 可行的关键路径
  3. 安全是 Agent 的第一优先级:Lynk & Co 事故证明,没有安全门控的语音控制是危险的

6.2 对 Lynk & Co 事故的反思

Lynk & Co Z20 事故是座舱 AI 安全的里程碑事件:

  • 根因:单模态(纯语音)+ 无安全约束 + 无场景校验
  • 教训:座舱 AI 必须有多模态上下文和安全门控
  • 机遇:这恰恰是 Smart Eye 多模态方案的价值主张

6.3 长期趋势

到 2030 年,座舱 Agent 将成为 OEM 差异化竞争的核心战场:

维度 2026 2030
感知 DMS+OMS DMS+OMS+雷达+环境感知全融合
决策 规则驱动 LLM 驱动+安全约束
执行 车内功能 车内+V2X+智能家居
学习 无 个性化持续学习
算力 边缘小模型 边缘+云协同

7. 参考


Smart Eye 多模态座舱 AI Agent:从感知到行动的座舱智能体跃迁(InCabin 2026 深度解析)
https://dapalm.com/2026/10/05/2026-10-05-016-smart-eye-multimodal-cabin-ai-agent/
作者
Mars
发布于
2026年10月5日
许可协议