条件自动驾驶驾驶员状态检测全景综述:从单模态到多模态融合的演进 论文信息
项目
内容
标题
Driver state detection and recognition in conditional automated driving: A review
发表
PLOS ONE, 2026 (doi:10.1371/journal.pone.0358700)
类型
系统综述
关键词
driver state, conditional automation, physiological, vision-based, vehicle-performance
核心价值 这是2026年最全面的驾驶员状态检测综述,系统比较了 三大模态族 (生理信号/视觉行为/车辆控制)的性能、局限和融合策略。对IMS团队制定技术路线具有直接指导价值。
1. 三大模态族 1.1 模态分类 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 驾驶员状态检测 ├── 生理信号 (Physiological) │ ├── EEG (脑电) │ ├── ECG/HRV (心电/ 心率变异) │ ├── EOG (眼电) │ ├── EMG (肌电) │ ├── EDA (皮肤电) │ └── Respiration (呼吸) │ ├── 视觉行为 (Vision-based) │ ├── 眼睑闭合 (PERCLOS) │ ├── 眨眼频率 │ ├── 面部表情 │ ├── 头部姿态 │ └── 视线方向 │ └── 车辆控制 (Vehicle-performance) ├── 方向盘角度 ├── 速度变异 ├── 车道偏离 (SDLP) └── 加速/制动模式
1.2 性能对比
模态族
最佳方法
准确率
量产可行性
延迟
生理融合
SA+LSTM (EEG+EMG+脉搏+呼吸+GSR)
98.63%
❌ 不可量产
低
生理融合
CNN (EEG+EDA+ECG)
82% (LOSO)
❌
中
生理单一
LSTM (EEG)
85.6%
❌
低
视觉融合
CNN+关键点
~92%
✅
高
视觉单一
PERCLOS阈值
~80%
✅ 已量产
高
车辆控制
集成分类器(DT/RF/GB)
~75%
✅ 已有传感器
高
1.3 关键发现
“Physiological sensing produced consistent signal outputs across the studies in which it was employed.”
“A stacked autoencoder and attention-LSTM system applied to EEG, facial EMG, pulse rate, respiration, and GSR data achieved 98.63% accuracy in a simulator study”
“A multi-branch deep CNN fusion of EEG, EDA, and ECG signals achieved 82% under leave-one-subject-out cross-validation”
2. 深度学习架构对比 2.1 架构性能排名
排名
架构
模态
准确率
特点
1
SA+Attention-LSTM
5模态生理
98.63%
最高但不可量产
2
CNN+Transformer
视觉+生理
95%
前沿但复杂
3
多分支CNN
3模态生理
82% (LOSO)
严格验证
4
LSTM
EEG单模态
85.6%
时序建模强
5
CNN
视觉单模态
92%
量产可行
6
集成分类器
车辆控制
75%
成本最低
2.2 架构演进趋势 graph LR
A[2018: 单模态CNN] --> B[2020: 双模态融合]
B --> C[2022: 多模态CNN]
C --> D[2024: LSTM+注意力]
D --> E[2025: Transformer]
E --> F[2026: SA+Attention-LSTM 98.63%]
style F fill:#ff9,stroke:#333
3. 量产可行性评估 3.1 模态量产可行性矩阵
模态
检测力
量产可行性
成本
推荐等级
PERCLOS
⭐⭐⭐
⭐⭐⭐⭐⭐
$0
✅ 必选
视线方向
⭐⭐⭐⭐
⭐⭐⭐⭐
$0
✅ 必选
头部姿态
⭐⭐⭐
⭐⭐⭐⭐⭐
$0
✅ 必选
rPPG/IR-rPPG
⭐⭐⭐
⭐⭐⭐⭐
$0-5
🟡 推荐
方向盘扭矩
⭐⭐
⭐⭐⭐⭐⭐
$0
🟡 推荐
60GHz雷达
⭐⭐⭐⭐
⭐⭐⭐
$15-30
🟡 推荐
EEG
⭐⭐⭐⭐⭐
⭐
$500+
❌ 不可量产
ECG方向盘
⭐⭐⭐⭐
⭐⭐⭐
$5
🟢 可选
EDA
⭐⭐
⭐⭐
$10
❌ 不推荐
3.2 量产推荐配置
级别
模态组合
预期准确率
成本/车
基础
PERCLOS+视线+头姿
~85%
$0
标准
基础+IR rPPG+方向盘
~90%
$0-5
高级
标准+60GHz雷达
~93%
$15-35
旗舰
高级+ECG方向盘+热成像
~95%
$25-50
4. 条件自动驾驶特殊挑战 4.1 SAE L3的接管问题
挑战
描述
当前方案
接管准备度
驾驶员是否准备好接管
视线+头姿评估
警觉退化
自动驾驶时警觉下降
PERCLOS+心率
模式切换
自动→手动切换延迟
预警+渐进移交
信任校准
过度/不足信任
交互式反馈
4.2 与Euro NCAP对接
NCAP场景
综述推荐模态
量产方案
疲劳检测
PERCLOS+EEG
PERCLOS+IR rPPG
分心检测
视线+车辆
视线+方向盘
酒驾检测
生理+车辆
运动学PE+IR rPPG
CPD
不适用
60GHz雷达
OOP
视觉+压力
摄像头+压力垫
5. 融合策略对比 5.1 融合层次
层次
方法
代表
优势
劣势
数据级
原始信号融合
SA+LSTM
信息最全
对齐困难
特征级
特征拼接
多分支CNN
灵活
冗余
决策级
投票/加权
集成分类器
简单
信息损失
注意力级
Cross-attention
Transformer
自适应权重
计算量大
5.2 融合性能
策略
模态数
准确率
计算量
数据级(SA+LSTM)
5
98.63%
极高
特征级(CNN)
3
82%
中
决策级(投票)
3
78%
低
注意力级(Transformer)
4
93%
高
6. IMS开发启示 6.1 短期路线(2026-2027)
优先级
行动
依据
🔴
PERCLOS+视线+头姿三模态融合
量产可行,~85%
🔴
IR rPPG补充心率
零硬件成本,~90%
🟡
方向盘运动学PE
酒驾辅助
🟢
60GHz雷达评估
CPD+生命体征
6.2 中期路线(2027-2028)
行动
目标
注意力级融合架构
从特征拼接升级到cross-attention
驾驶风格个性化
降低误报率
接管准备度模型
L3自动驾驶场景
PixExpo/多曝光
rPPG鲁棒性提升
6.3 长期路线(2028+)
方向
目标
Cosmos合成数据训练
覆盖罕见场景
3D-CRNN时序建模
认知分心检测
多模态芯片级融合
单芯片处理全部模态
SOTIF辅助监督
乘员认知→ADAS决策
7. 总结 综述的核心结论:
生理信号最强但不可量产 — 98.63%但需EEG/EMG
视觉+车辆是量产最优解 — ~90%准确率,成本可接受
融合层次决定上限 — 数据级>特征级>决策级
L3接管是核心新挑战 — 传统DMS不够
注意力机制是趋势 — 自适应融合优于固定权重
对IMS团队:
立即 实现PERCLOS+视线+头姿三模态特征级融合
短期 添加IR rPPG作为第四模态
中期 升级到注意力级融合架构
对标 Euro NCAP全场景设计验证
综述: https://journals.plos.org/plosone/article?id=10.1371/journal.pone.0358700