GazeFlow:生成式条件流匹配的自我中心视线预测(NeurIPS 2026 论文解读+代码复现)
GazeFlow:生成式条件流匹配的自我中心视线预测
论文信息
| 项目 | 内容 |
|---|---|
| 标题 | GazeFlow: From Human Gaze Behavior to Generative Egocentric Gaze Prediction |
| 作者 | Sheng Zhao, Weikai Lin, Yuhao Zhu |
| 机构 | University of Rochester, Department of Computer Science |
| 会议 | NeurIPS 2026(Accepted) |
| 链接 | arXiv:2609.38519 |
| 代码 | 待开源(GitHub) |
核心创新
GazeFlow 首次将自我中心视线预测(egocentric gaze prediction)建模为条件联合分布问题,使用条件流匹配(Conditional Flow Matching, CFM)生成式框架,从高斯噪声出发,通过学习速度场迭代传输到合理的视线轨迹。
三大创新点:
- 联合分布建模 — 不再逐帧独立预测,而是建模整条视线轨迹的联合分布
- 双向条件 — 同时利用自下而上(视觉显著性)和自上而下(任务上下文)信息
- 生成式轨迹 — 生成多条合理轨迹,捕捉人类视线的随机性
graph TD
A[输入视频帧] --> B[视频编码器]
B --> C[自下而上特征<br/>视觉显著性]
B --> D[全局查询<br/>自上而下任务信息]
C --> E[条件流匹配 CFM]
D --> E
F[高斯噪声采样] --> E
E --> G[视线轨迹<br/>注视+扫视序列]
G --> H[每帧视线热力图]
方法详解
1. 问题定义
传统视线预测逐帧独立建模 $P(g_t | V)$,其中 $g_t$ 是第 $t$ 帧的视线位置,$V$ 是视频。GazeFlow 建模整条轨迹的联合分布:
$$P(g_1, g_2, …, g_T | V)$$
其中 $g_{1:T}$ 是一条完整的视线轨迹。这样能捕捉注视(fixation)和扫视(saccade)之间的时序依赖关系。
2. 条件流匹配(CFM)
GazeFlow 使用条件流匹配生成视线轨迹:
- 起点:从标准高斯分布 $\mathcal{N}(0, I)$ 采样噪声
- 终点:一条合理的视线轨迹
- 传输路径:通过学习速度场 $v_\theta(g_t, t | V)$ 迭代传输
数学公式:
$$\frac{dg_t}{dt} = v_\theta(g_t, t | V_{bottom-up}, V_{top-down})$$
其中 $V_{bottom-up}$ 是视频编码器提取的时空视觉特征,$V_{top-down}$ 是通过全局查询获得的任务相关特征。
3. 视频编码器
使用预训练视频编码器(如 VideoMAE 或 TimeSformer)提取时空特征:
1 | |
4. 任务查询模块
通过全局查询机制获取自上而下任务信息:
1 | |
5. 条件流匹配核心
1 | |
6. 完整GazeFlow模型
1 | |
实验结果
数据集
| 数据集 | 场景 | 样本量 | 评估指标 |
|---|---|---|---|
| EGTEA Gaze+ | 自我中心视频 | 86 sessions | AUC, CC, SIM, KLD |
| Ego4D | 大规模自我中心 | 1,421 hours | AUC, CC |
性能对比
| 方法 | AUC ↑ | CC ↑ | SIM ↑ | KLD ↓ | 轨迹质量 |
|---|---|---|---|---|---|
| AT (2023) | 0.891 | 0.473 | 0.331 | 2.18 | 逐帧独立 |
| GLC (2024) | 0.898 | 0.481 | 0.338 | 2.12 | 局部时序 |
| EgoM2P (2025) | 0.905 | 0.492 | 0.345 | 2.05 | 局部时序 |
| GazeFlow (2026) | 0.918 | 0.514 | 0.358 | 1.89 | 全局时序+生成式 |
轨迹时间动态分析
GazeFlow 生成的轨迹在注视-扫视模式上更符合人类真实眼动规律:
| 指标 | 真实数据 | GazeFlow | EgoM2P |
|---|---|---|---|
| 注视时长(ms) | 240±85 | 235±78 | 198±112 |
| 扫视幅度(°) | 4.2±2.8 | 4.5±3.1 | 6.8±4.2 |
| 微扫视频率(Hz) | 1.2 | 1.1 | 0.3 |
IMS 应用启示
1. DMS 视线轨迹建模
GazeFlow 的生成式框架可直接增强 DMS 视线估计:
| 应用场景 | 当前方案 | GazeFlow改进 |
|---|---|---|
| 视线落点估计 | 逐帧独立预测 | 轨迹级建模,捕捉注视模式 |
| 分心检测 | PERCLOS/偏离角度 | 视线轨迹熵+异常模式 |
| 驾驶意图预测 | 基于规则 | 任务条件gaze生成 |
| 数据增强 | 无 | 生成合理gaze轨迹扩充训练集 |
2. 部署架构建议
1 | |
3. Euro NCAP 关联
| Euro NCAP 2026 要求 | GazeFlow 可贡献 |
|---|---|
| D-01 视线偏离道路 >3s | 轨迹级偏离检测更鲁棒 |
| D-02 手机使用 | 视线轨迹模式分类 |
| D-03 注意力分散 | 生成式异常检测 |
| F-01 PERCLOS | 注视模式时序分析 |
开发优先级
| 优先级 | 任务 | 工作量 | 预期收益 |
|---|---|---|---|
| P0 | 复现GazeFlow在EGTEA上的结果 | 3人周 | 验证方法有效性 |
| P1 | 适配DMS数据集(NTHU/DDD) | 2人周 | 车载场景验证 |
| P2 | 轻量化部署(INT8, <10MB) | 2人周 | 边缘部署可行 |
| P3 | 集成到IMS框架 | 1人周 | 产品级集成 |
代码测试
1 | |
预期输出:
1 | |
总结
GazeFlow 是视线预测领域的重要突破:
- 范式转变 — 从判别式逐帧预测到生成式轨迹建模
- NeurIPS 2026 接收 — 学术界认可其理论贡献
- IMS落地路径清晰 — 轻量化后可直接增强DMS视线模块
- 生成式异常检测 — 可通过”合理轨迹”分布检测异常驾驶行为
建议IMS团队优先复现核心CFM模块,评估在DMS数据上的效果。
GazeFlow:生成式条件流匹配的自我中心视线预测(NeurIPS 2026 论文解读+代码复现)
https://dapalm.com/2026/10/07/2026-10-07-001-gazeflow-generative-egocentric-gaze-neurips2026/