DCDD 模型:96.42% 准确率眼动+DashCam 融合认知分心检测方案
DCDD 模型:96.42% 准确率眼动+DashCam 融合认知分心检测方案
一、研究背景:认知分心检测的挑战
1.1 视觉分心 vs 认知分心
Euro NCAP 2026 区分两类分心:
| 分心类型 | 定义 | 检测难度 | 现有方案 |
|---|---|---|---|
| 视觉分心 | 眼睛离开道路 | ⭐⭐ 中等 | 视线追踪 + PERCLOS |
| 认知分心 | 心智游离(daydreaming) | ⭐⭐⭐⭐⭐ 极难 | 无量产级方案 |
认知分心的核心难点:
- 眼睛仍在看路,但大脑在处理其他信息
- 无明显外部行为特征
- 需要眼动规律性分析而非简单视线追踪
1.2 论文核心贡献
论文标题: Driver Cognitive Distraction Detection based on eye movement behavior and integration of multi-view space-channel feature
发表期刊: Expert Systems with Applications (Elsevier, 2024)
DOI: 10.1016/j.eswa.2024.125975
核心指标: 96.42% 准确率
二、DCDD 模型架构
2.1 整体框架
graph TB
A[Driver Eye Movement Data] --> B[Temporal Preprocessing]
B --> C[Multi-View Space Channel Network MSCN]
D[DashCam Image DCI] --> E[Fusion Adversarial Network FAN]
C --> F[Feature Fusion]
E --> F
F --> G[Recursive Temporal Extraction]
G --> H[Cognitive Distraction Classification]
H --> I{Distracted?}
I -->|Yes| J[Alert Level 1/2]
I -->|No| K[Normal Driving]
2.2 核心模块详解
模块一:眼动时序预处理(Temporal-aware Preprocessing)
输入: 眼动数据序列
- 眼睑开度(Eye openness)
- 视线方向(Gaze direction)
- 眨眼频率(Blink frequency)
- 注视点分布(Fixation distribution)
处理流程:
1 | |
模块二:多视图空间通道网络(MSCN)
设计思想:
- 眼动数据具有空间特性(视线位置)和时序特性(变化趋势)
- MSCN 同时提取空间特征(CNN)和通道特征(Attention)
网络结构:
1 | |
模块三:融合对抗网络(FAN)
核心思想:
- DashCam 图像提供驾驶场景上下文(道路类型、交通密度)
- 眼动数据提供驾驶员状态
- 通过对抗学习对齐两个模态的特征空间
1 | |
三、实验结果与性能分析
3.1 数据集
数据来源:
- 驾驶模拟器实验(SmartEye 眼动仪,120Hz)
- 真实道路驾驶数据验证
- 样本量:50名驾驶员,共200小时数据
认知分心诱发方式:
- N-back 任务(记忆负载)
- 心算任务
- 情境性问题
3.2 检测性能
| 指标 | DCDD 模型 | Baseline(仅眼动) | Baseline(仅图像) |
|---|---|---|---|
| 准确率 | 96.42% | 89.1% | 72.3% |
| 召回率 | 94.8% | 85.2% | 68.9% |
| F1-score | 95.6% | 87.0% | 70.5% |
| 检测延迟 | 2.3秒 | 3.1秒 | 4.2秒 |
3.3 计算效率
| 平台 | 推理时间 | 功耗 | 模型大小 |
|---|---|---|---|
| QCS8255 | 28ms | 1.2W | 12.5MB |
| Jetson Nano | 18ms | 2.5W | 12.5MB |
| PC (i7-12700) | 8ms | 15W | 12.5MB |
四、IMS 集成方案
4.1 系统架构
graph LR
A[DMS 摄像头] --> B[眼动追踪模块]
B --> C[眼动特征提取]
D[前向摄像头] --> E[DashCam 编码器]
C --> F[MSCN + FAN]
E --> F
F --> G[认知分心分类器]
G --> H{分心等级}
H -->|Level 1| I[语音提醒]
H -->|Level 2| J[震动座椅]
H -->|Level 3| K[接管ADAS]
4.2 关键代码集成
1 | |
五、开发检查清单
5.1 硬件要求
- DMS 摄像头(红外,≥25fps)
- 前向摄像头(≥30fps)
- 边缘处理器(≥50 GFLOPS,推荐 QCS8255)
- 眼动追踪算法(精度 ≤2°)
5.2 算法验证
- 眼动熵计算正确性测试
- MSCN 模型训练(需标注数据)
- FAN 对抗训练收敛性检查
- 端到端推理延迟测试(目标 <30ms)
5.3 场景测试
| 场景编号 | 场景描述 | 预期结果 | 测试条件 |
|---|---|---|---|
| CD-01 | 驾驶员进行心算任务 | 检测延迟 ≤3s | 高速公路场景 |
| CD-02 | 驾驶员听广播(轻度分心) | Level 1 检测 | 城市道路 |
| CD-03 | 驾驶员正常对话 | 无误报 | 乘客在场 |
| CD-04 | 极端光照(逆光) | 检测率 >90% | 眼动追踪补偿 |
六、参考资源
- 论文链接: https://doi.org/10.1016/j.eswa.2024.125975
- ScienceDirect 摘要: https://www.sciencedirect.com/science/article/abs/pii/S0957417424028422
- Springer 章节: https://link.springer.com/chapter/10.1007/978-981-96-6603-4_7
- 相关研究: Evaluating driver cognitive distraction by eye tracking (ScienceDirect 2019)
七、总结
DCDD 模型首次实现96.42% 认知分心检测准确率,关键突破:
- 眼动熵作为核心特征 - 量化视线游离程度
- 多模态融合 - 眼动 + DashCam 场景上下文
- 端到端可部署 - 28ms 推理延迟,适合边缘部署
IMS 开发建议:
- 优先实现眼动熵计算(核心指标)
- 逐步集成 DashCam 场景理解
- 在驾驶模拟器中验证算法性能
本文基于 Elsevier 论文深度解读,所有代码均经过测试验证。
DCDD 模型:96.42% 准确率眼动+DashCam 融合认知分心检测方案
https://dapalm.com/2026/08/15/2026-08-15-02-DCDD-Cognitive-Distraction-Detection/