条件自动驾驶驾驶员状态检测全景综述:从单模态到多模态融合的演进

条件自动驾驶驾驶员状态检测全景综述:从单模态到多模态融合的演进

论文信息

项目 内容
标题 Driver state detection and recognition in conditional automated driving: A review
发表 PLOS ONE, 2026 (doi:10.1371/journal.pone.0358700)
类型 系统综述
关键词 driver state, conditional automation, physiological, vision-based, vehicle-performance

核心价值

这是2026年最全面的驾驶员状态检测综述,系统比较了 三大模态族(生理信号/视觉行为/车辆控制)的性能、局限和融合策略。对IMS团队制定技术路线具有直接指导价值。

1. 三大模态族

1.1 模态分类

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
驾驶员状态检测
├── 生理信号 (Physiological)
│ ├── EEG (脑电)
│ ├── ECG/HRV (心电/心率变异)
│ ├── EOG (眼电)
│ ├── EMG (肌电)
│ ├── EDA (皮肤电)
│ └── Respiration (呼吸)
│
├── 视觉行为 (Vision-based)
│ ├── 眼睑闭合 (PERCLOS)
│ ├── 眨眼频率
│ ├── 面部表情
│ ├── 头部姿态
│ └── 视线方向
│
└── 车辆控制 (Vehicle-performance)
├── 方向盘角度
├── 速度变异
├── 车道偏离 (SDLP)
└── 加速/制动模式

1.2 性能对比

模态族 最佳方法 准确率 量产可行性 延迟
生理融合 SA+LSTM (EEG+EMG+脉搏+呼吸+GSR) 98.63% ❌ 不可量产 低
生理融合 CNN (EEG+EDA+ECG) 82% (LOSO) ❌ 中
生理单一 LSTM (EEG) 85.6% ❌ 低
视觉融合 CNN+关键点 ~92% ✅ 高
视觉单一 PERCLOS阈值 ~80% ✅ 已量产 高
车辆控制 集成分类器(DT/RF/GB) ~75% ✅ 已有传感器 高

1.3 关键发现

“Physiological sensing produced consistent signal outputs across the studies in which it was employed.”

“A stacked autoencoder and attention-LSTM system applied to EEG, facial EMG, pulse rate, respiration, and GSR data achieved 98.63% accuracy in a simulator study”

“A multi-branch deep CNN fusion of EEG, EDA, and ECG signals achieved 82% under leave-one-subject-out cross-validation”

2. 深度学习架构对比

2.1 架构性能排名

排名 架构 模态 准确率 特点
1 SA+Attention-LSTM 5模态生理 98.63% 最高但不可量产
2 CNN+Transformer 视觉+生理 95% 前沿但复杂
3 多分支CNN 3模态生理 82% (LOSO) 严格验证
4 LSTM EEG单模态 85.6% 时序建模强
5 CNN 视觉单模态 92% 量产可行
6 集成分类器 车辆控制 75% 成本最低

2.2 架构演进趋势

graph LR
    A[2018: 单模态CNN] --> B[2020: 双模态融合]
    B --> C[2022: 多模态CNN]
    C --> D[2024: LSTM+注意力]
    D --> E[2025: Transformer]
    E --> F[2026: SA+Attention-LSTM 98.63%]
    
    style F fill:#ff9,stroke:#333

3. 量产可行性评估

3.1 模态量产可行性矩阵

模态 检测力 量产可行性 成本 推荐等级
PERCLOS ⭐⭐⭐ ⭐⭐⭐⭐⭐ $0 ✅ 必选
视线方向 ⭐⭐⭐⭐ ⭐⭐⭐⭐ $0 ✅ 必选
头部姿态 ⭐⭐⭐ ⭐⭐⭐⭐⭐ $0 ✅ 必选
rPPG/IR-rPPG ⭐⭐⭐ ⭐⭐⭐⭐ $0-5 🟡 推荐
方向盘扭矩 ⭐⭐ ⭐⭐⭐⭐⭐ $0 🟡 推荐
60GHz雷达 ⭐⭐⭐⭐ ⭐⭐⭐ $15-30 🟡 推荐
EEG ⭐⭐⭐⭐⭐ ⭐ $500+ ❌ 不可量产
ECG方向盘 ⭐⭐⭐⭐ ⭐⭐⭐ $5 🟢 可选
EDA ⭐⭐ ⭐⭐ $10 ❌ 不推荐

3.2 量产推荐配置

级别 模态组合 预期准确率 成本/车
基础 PERCLOS+视线+头姿 ~85% $0
标准 基础+IR rPPG+方向盘 ~90% $0-5
高级 标准+60GHz雷达 ~93% $15-35
旗舰 高级+ECG方向盘+热成像 ~95% $25-50

4. 条件自动驾驶特殊挑战

4.1 SAE L3的接管问题

挑战 描述 当前方案
接管准备度 驾驶员是否准备好接管 视线+头姿评估
警觉退化 自动驾驶时警觉下降 PERCLOS+心率
模式切换 自动→手动切换延迟 预警+渐进移交
信任校准 过度/不足信任 交互式反馈

4.2 与Euro NCAP对接

NCAP场景 综述推荐模态 量产方案
疲劳检测 PERCLOS+EEG PERCLOS+IR rPPG
分心检测 视线+车辆 视线+方向盘
酒驾检测 生理+车辆 运动学PE+IR rPPG
CPD 不适用 60GHz雷达
OOP 视觉+压力 摄像头+压力垫

5. 融合策略对比

5.1 融合层次

层次 方法 代表 优势 劣势
数据级 原始信号融合 SA+LSTM 信息最全 对齐困难
特征级 特征拼接 多分支CNN 灵活 冗余
决策级 投票/加权 集成分类器 简单 信息损失
注意力级 Cross-attention Transformer 自适应权重 计算量大

5.2 融合性能

策略 模态数 准确率 计算量
数据级(SA+LSTM) 5 98.63% 极高
特征级(CNN) 3 82% 中
决策级(投票) 3 78% 低
注意力级(Transformer) 4 93% 高

6. IMS开发启示

6.1 短期路线(2026-2027)

优先级 行动 依据
🔴 PERCLOS+视线+头姿三模态融合 量产可行,~85%
🔴 IR rPPG补充心率 零硬件成本,~90%
🟡 方向盘运动学PE 酒驾辅助
🟢 60GHz雷达评估 CPD+生命体征

6.2 中期路线(2027-2028)

行动 目标
注意力级融合架构 从特征拼接升级到cross-attention
驾驶风格个性化 降低误报率
接管准备度模型 L3自动驾驶场景
PixExpo/多曝光 rPPG鲁棒性提升

6.3 长期路线(2028+)

方向 目标
Cosmos合成数据训练 覆盖罕见场景
3D-CRNN时序建模 认知分心检测
多模态芯片级融合 单芯片处理全部模态
SOTIF辅助监督 乘员认知→ADAS决策

7. 总结

综述的核心结论:

  1. 生理信号最强但不可量产 — 98.63%但需EEG/EMG
  2. 视觉+车辆是量产最优解 — ~90%准确率,成本可接受
  3. 融合层次决定上限 — 数据级>特征级>决策级
  4. L3接管是核心新挑战 — 传统DMS不够
  5. 注意力机制是趋势 — 自适应融合优于固定权重

对IMS团队:

  • 立即 实现PERCLOS+视线+头姿三模态特征级融合
  • 短期 添加IR rPPG作为第四模态
  • 中期 升级到注意力级融合架构
  • 对标 Euro NCAP全场景设计验证

综述: https://journals.plos.org/plosone/article?id=10.1371/journal.pone.0358700


条件自动驾驶驾驶员状态检测全景综述:从单模态到多模态融合的演进
https://dapalm.com/2026/10/08/2026-10-08-022-driver-state-detection-review-conditional-automation-plos2026/
作者
Mars
发布于
2026年10月8日
许可协议