EyeCue:基于眼动-视频融合的驾驶员认知分心检测突破
EyeCue:基于眼动-视频融合的驾驶员认知分心检测突破
论文信息
- 标题: Driver Cognitive Distraction Detection via Gaze-Empowered Egocentric Video Understanding
- 作者: JinYi Yoon, Matthew Corbett, Abhijit Sarkar, Bo Ji
- 机构: Virginia Tech, Inha University, Army Cyber Institute at West Point
- 会议: arXiv 2605.07859
- 年份: 2026
- 链接: https://arxiv.org/abs/2605.07859
- 代码: https://github.com/langzhang2000/EyeCue
核心创新
首次提出融合眼动与第一视角视频的认知分心检测框架,解决认知分心”不可观察”的难题。传统方法依赖侵入式传感器(EEG、问卷),EyeCue实现非接触式实时检测,准确率达74.38%,超越11种基线方法7%以上。
技术突破点
| 技术点 | 传统方法 | EyeCue突破 |
|---|---|---|
| 检测方式 | EEG侵入式/问卷中断式 | 眼动+视频非接触 |
| 上下文建模 | 单帧图像 | 时序视频理解 |
| 泛化能力 | 单场景 | 多场景(道路类型/天气/时间) |
| 数据规模 | 小样本 | CogDrive数据集3662样本 |
方法详解
1. 问题定义
认知分心(Cognitive Distraction):驾驶员注意力被与驾驶无关的思维分散,即使视线仍在道路上。
三种分心类型对比:
| 类型 | 定义 | 可观察性 | 传统检测方法 |
|---|---|---|---|
| 手动分心 | 手离开方向盘 | 高 | 摄像头姿态估计 |
| 视觉分心 | 视线偏离道路 | 高 | 眼动追踪 |
| 认知分心 | 思维分散 | 低 | EEG/问卷 |
2. 核心架构
1 | |
3. GDSQ模块详解
核心思想:用眼动数据动态选择视觉token,模拟驾驶员”看什么”的注意力分配。
1 | |
4. CogDrive数据集
数据集构成:
| 来源 | 原始数据 | 标注样本 | 场景覆盖 |
|---|---|---|---|
| DR(eye)VE | 眼动+视频 | 598 | 城市道路 |
| BDD-A | 眼动+视频 | 812 | 多道路类型 |
| DADA-2000 | 眼动+视频 | 1247 | 危险场景 |
| TrafficGaze | 眼动+视频 | 1005 | 复杂交通 |
| 总计 | - | 3662 | 多场景 |
标注流程:
- 提取眼动序列(注视点、持续时间、瞳孔大小)
- 提取第一视角视频片段(16帧,约0.5秒)
- 人工标注认知分心标签(0=专注,1=分心)
- 质量控制:双人标注,冲突样本仲裁
实验结果
1. 主实验结果
| 方法类型 | 代表方法 | 准确率 | F1-Score |
|---|---|---|---|
| 仅眼动 | Gaze-Only | 62.3% | 0.58 |
| 视频分类 | TimeSformer | 65.1% | 0.61 |
| 第一视角 | EgoVLP | 66.8% | 0.63 |
| 基础模型 | CLIP | 64.5% | 0.60 |
| 眼动+图像 | DCDD | 67.2% | 0.64 |
| 眼动+视频 | Voila-A | 68.9% | 0.66 |
| EyeCue | 本文方法 | 74.38% | 0.72 |
关键发现:
- 眼动-视频融合比单模态提升8-12%
- GDSQ模块贡献**5%**准确率提升
- 跨场景泛化稳定(不同道路/天气/时间)
2. 消融实验
| 组件 | 准确率 | 说明 |
|---|---|---|
| Full Model | 74.38% | 完整模型 |
| w/o GDSQ | 69.2% | 移除眼动引导模块 |
| w/o Video Encoder | 67.5% | 仅用眼动 |
| w/o Gaze Encoder | 68.9% | 仅用视频 |
| w/o Temporal | 70.1% | 单帧处理 |
结论: GDSQ模块是核心贡献,带来**5%**准确率提升。
3. 跨场景泛化
| 场景 | 准确率 | 样本数 |
|---|---|---|
| 城市道路 | 75.2% | 1245 |
| 高速公路 | 73.8% | 892 |
| 乡村道路 | 72.1% | 634 |
| 夜间驾驶 | 71.5% | 423 |
| 雨天驾驶 | 70.8% | 368 |
泛化能力验证:
- 不同道路类型:准确率波动<3%
- 不同天气条件:准确率波动<4%
- 不同时间:准确率波动<3%
IMS开发启示
1. 技术路线建议
| 阶段 | 目标 | 输入 | 算法 | 性能指标 |
|---|---|---|---|---|
| Phase 1 | 原型验证 | 眼动+视频 | TimeSformer + Transformer | 准确率>70% |
| Phase 2 | 边缘优化 | 眼动+视频 | MobileViT + 轻量化Transformer | 帧率>15fps |
| Phase 3 | 实车部署 | 眼动+视频 | 量化模型 + NPU加速 | 帧率>30fps |
2. 硬件选型
| 组件 | 型号 | 参数 | 成本 |
|---|---|---|---|
| 眼动追踪 | Tobii 4C | 90Hz, ±0.5°精度 | $150 |
| 第一视角摄像头 | GoPro Hero 11 | 4K@60fps, 120°FOV | $400 |
| 计算平台 | Jetson Orin NX | 100 TOPS, 16GB | $500 |
| 总成本 | - | - | ~$1050 |
3. 部署优化
1 | |
4. 与现有系统集成
1 | |
5. 测试场景设计
| 场景ID | 场景描述 | 认知分心类型 | 检测时限 |
|---|---|---|---|
| C-01 | 驾驶员沉思复杂问题 | 思维游离 | ≤3秒 |
| C-02 | 驾驶员回忆往事 | 内部分心 | ≤3秒 |
| C-03 | 驾驶员规划路线 | 认知负荷 | ≤4秒 |
| C-04 | 驾驶员情绪波动 | 情感分心 | ≤3秒 |
验证方法:
- 模拟器实验:在驾驶模拟器中诱发认知分心
- 真实道路:在安全路段进行测试(需监管)
- 对比基线:与EEG测量结果对比验证
6. 性能优化建议
| 优化方向 | 方法 | 预期提升 |
|---|---|---|
| 模型压缩 | 知识蒸馏 + 量化 | 体积减少75% |
| 推理加速 | TensorRT优化 | 帧率提升3倍 |
| 功耗优化 | 动态帧率调整 | 功耗降低40% |
| 精度提升 | 多任务学习 | 准确率+3% |
局限性与未来方向
当前局限
| 局限 | 影响 | 解决方向 |
|---|---|---|
| 需要眼动追踪硬件 | 成本增加 | 基于摄像头的眼动估计 |
| 需要第一视角视频 | 安装复杂 | 车内固定摄像头 |
| 样本规模有限 | 泛化受限 | 扩充数据集 |
| 实时性待优化 | 部署受限 | 模型轻量化 |
未来研究方向
- 多模态融合:加入生理信号(心率变异性)
- 个性化建模:针对不同驾驶员建模
- 场景自适应:根据驾驶场景调整阈值
- 轻量化部署:面向量产的边缘计算优化
总结
EyeCue首次实现非接触式认知分心检测,准确率74.38%,为Euro NCAP 2026认知分心要求提供可行方案。核心贡献:
- GDSQ模块:眼动引导的语义查询,准确率提升5%
- CogDrive数据集:3662样本,多场景覆盖
- 跨场景泛化:不同道路/天气/时间稳定表现
- 非接触方案:无需EEG,适合量产部署
IMS开发建议:
- Phase 1原型验证(3个月)
- Phase 2边缘优化(6个月)
- Phase 3实车部署(12个月)
预期效果:
- 检测准确率:>70%
- 检测延迟:<3秒
- 硬件成本:< $1000
参考论文:
- Yoon et al. “Driver Cognitive Distraction Detection via Gaze-Empowered Egocentric Video Understanding”, arXiv 2605.07859, 2026
- Palazzi et al. “DR(eye)VE: A Dataset for Attention Prediction in Driving”, ECCV 2018
EyeCue:基于眼动-视频融合的驾驶员认知分心检测突破
https://dapalm.com/2026/08/16/2026-08-12-EyeCue-Cognitive-Distraction-Detection-Gaze-Video/