EyeCue 论文解读:眼动增强的第一人称视频认知分心检测
EyeCue 论文解读:眼动增强的第一人称视频认知分心检测
论文信息
- 标题:EyeCue: Driver Cognitive Distraction Detection via Gaze-Empowered Egocentric Video Understanding
- 会议:IJCAI 2026(International Joint Conference on Artificial Intelligence)
- arXiv:2605.07859
- 开源代码:https://github.com/langzhang2000/EyeCue
- 数据集:CogDrive(多场景认知分心标注数据集)
核心创新
EyeCue 提出了一种 眼动增强的第一人称视频理解框架,用于检测驾驶员认知分心。关键洞察:认知分心体现在 眼动与视觉上下文的交互 中,而非单纯的视觉偏离。
突破点:
- 跨模态交互建模:融合眼动数据与第一人称视频,实现上下文感知的注意力建模
- CogDrive 数据集:增强4个现有驾驶数据集,提供认知分心标注
- 强泛化性:准确率 74.38%,超过11个基线模型7%+,跨场景准确率 >70%
问题定义
认知分心 vs 视觉分心
| 类型 | 特征 | 检测难度 |
|---|---|---|
| 视觉分心 | 视线偏离道路,有明确物理动作 | ⭐⭐ |
| 手动分心 | 手部操作手机/设备 | ⭐⭐⭐ |
| 认知分心 | 思想游离,视线可能仍在道路,无物理动作 | ⭐⭐⭐⭐⭐ |
核心挑战:认知分心时,驾驶员可能 保持视觉注意,但大脑已脱离驾驶任务,传统视觉方法难以检测。
方法详解
1. 整体架构
graph TB
subgraph 输入
A1[第一人称视频<br/>DashCam]
A2[眼动数据<br/>Eye Tracker]
end
subgraph 特征提取
B1[视觉特征<br/>ResNet-50]
B2[眼动特征<br/>位置+时序]
end
subgraph 跨模态融合
C1[注意力对齐<br/>Cross-Attention]
C2[时序建模<br/>Transformer]
end
subgraph 输出
D1[认知分心概率]
end
A1 --> B1
A2 --> B2
B1 --> C1
B2 --> C1
C1 --> C2
C2 --> D1
2. 眼动-视觉交互建模
1 | |
3. CogDrive 数据集
数据集构建:
| 源数据集 | 原始场景 | 认知分心标注 |
|---|---|---|
| A2D2 | 城市驾驶 | 认知负荷问答 |
| BDD100K | 多样化道路 | 心算任务 |
| Cityscapes | 街景 | 回忆任务 |
| Drive&Act | 真实驾驶 | 手机通话 |
标注方法:
- 受试者在驾驶时执行认知任务(心算、回忆、问答)
- 同步采集眼动数据 + 第一人称视频
- 标注认知分心时段
数据集统计:
- 总帧数:120,000+
- 认知分心样本:45,000+
- 正常驾驶样本:75,000+
- 场景类型:城市/高速/乡村
- 光照条件:白天/夜晚/黄昏
实验结果
1. 主实验对比
| 方法 | 准确率 | AUC | 备注 |
|---|---|---|---|
| ResNet-50(仅视觉) | 62.1% | 0.67 | 基线 |
| I3D(视频) | 65.3% | 0.71 | 时序建模 |
| Eye-Only(仅眼动) | 58.9% | 0.63 | 缺少上下文 |
| Early Fusion | 67.8% | 0.73 | 简单拼接 |
| Late Fusion | 68.5% | 0.74 | 后期融合 |
| EyeCue(本文) | 74.4% | 0.81 | 跨模态注意力 |
2. 跨场景泛化
| 场景 | 准确率 | 备注 |
|---|---|---|
| 城市道路 | 75.2% | 最佳 |
| 高速公路 | 72.8% | 场景相对单调 |
| 乡村道路 | 70.1% | 光照变化大 |
| 白天 | 74.9% | 训练数据多 |
| 夜晚 | 71.3% | 眼动噪声增加 |
| 雨天 | 68.5% | 视觉遮挡 |
3. 与 Euro NCAP 要求对比
| Euro NCAP 要求 | EyeCue 表现 | 达标情况 |
|---|---|---|
| 检测时延 ≤ 3s | 模型推理 ~100ms | ✅ 远超要求 |
| 准确率 > 70% | 74.4% | ✅ 达标 |
| 跨场景泛化 | >70% | ✅ 达标 |
| 夜间鲁棒性 | 71.3% | ⚠️ 接近阈值 |
IMS 开发启示
1. 部署架构
graph LR
A[红外摄像头] --> B[眼动追踪模块]
B --> C[注视点坐标]
C --> D[EyeCue 融合模块]
E[前视摄像头] --> F[视觉特征提取]
F --> D
D --> G{认知分心检测}
G -->|分心| H[一级警告]
G -->|正常| I[继续监测]
2. 硬件配置
| 组件 | 型号 | 成本 | 功能 |
|---|---|---|---|
| 眼动追踪 | Smart Eye AX1 | $150 | 注视点+瞳孔直径 |
| 前视摄像头 | OV2311 RGB-IR | $80 | 第一人称视频 |
| 融合处理器 | QCS8255 | $250 | EyeCue 推理 |
3. 部署时序
| 阶段 | 时间 | 目标 |
|---|---|---|
| 算法验证 | 2026 Q3 | 在 CogDrive 上复现 74%+ 准确率 |
| 车载数据采集 | 2026 Q4 | 采集真实驾驶眼动+视频数据 |
| 模型优化 | 2027 Q1 | INT8 量化,时延 < 200ms |
| Euro NCAP 测试 | 2027 Q2 | 通过官方认知分心测试 |
4. 代码集成建议
1 | |
技术挑战与解决方案
1. 挑战:眼动追踪鲁棒性
问题:夜间、逆光、戴眼镜时眼动追踪不稳定
解决方案:
- 使用红外照明(940nm)
- 多阈值自适应检测
- 眼动信号平滑滤波
2. 挑战:跨驾驶员差异
问题:不同驾驶员的眼动模式差异大
解决方案:
- 个性化基线校准(启动时 30s 正常驾驶)
- 在线学习微调
- 置信度阈值自适应
3. 挑战:实时性要求
问题:EyeCue 推理时延需优化
解决方案:
- 模型剪枝(通道剪枝 30%)
- INT8 量化(精度损失 < 2%)
- 知识蒸馏(MobileNet-V3 学生模型)
参考文献
Zhang, L., et al. (2026). EyeCue: Driver Cognitive Distraction Detection via Gaze-Empowered Egocentric Video Understanding. IJCAI 2026.
Euro NCAP (2025). Safe Driving Occupant Monitoring Protocol v1.0.
总结
EyeCue 通过 眼动-视觉跨模态交互建模,首次实现了高精度(74.4%)的驾驶员认知分心检测,并在跨场景泛化上表现出色(>70%)。
IMS 开发启示:
- 技术路线:眼动追踪 + 视频融合,避免单一模态局限
- 硬件选型:红外眼动追踪 + 前视摄像头,成本 ~$500/套
- 部署目标:2027 Q2 完成 Euro NCAP 认证测试
- 优化重点:夜间鲁棒性、个性化校准、实时推理优化
论文来源:IJCAI 2026 | arXiv:2605.07859 | IMS 研究笔记
EyeCue 论文解读:眼动增强的第一人称视频认知分心检测
https://dapalm.com/2026/08/10/2026-08-10-EyeCue-Cognitive-Distraction-IJCAI-2026/