错误归因:以 egocentric 视频为例的人类错误细粒度理解
计算机视觉与模式识别
2026-03-27 v2
摘要
我们提出了错误归因(Mistake Attribution,MATT),一个用于细粒度理解 egocentric 视频中人类错误的新任务。虽然已有工作检测错误是否发生,但 MATT 关注错误归因于指令的哪一部分被违反(语义角色)、错误何时在视频中变得不可逆(Point-of-No-Return,PNR),以及错误在 PNR 帧中的位置。我们开发了 MisEngine,一个自动从现有带有归因丰富标注的数据集中构建错误样本的数据引擎。应用于大型 egocentric 数据集后,MisEngine 生成了 EPIC-KITCHENS-M 和 Ego4D-M 两个规模可达原数据集两个数量级的数据集。我们随后提出 MisFormer,一个基于注意力机制的统一模型,用于跨语义、时间和空间维度的错误归因,采用 MisEngine 的监督进行训练。人类研究表明,我们构建的错误样本在生态有效性方面具有良好性,确认 EPIC-KITCHENS-M 和 Ego4D-M 可作为可靠的错误理解基准。在两个数据集以及先前基准测试上进行的实验显示,MisFormer 作为单一统一模型,分别在视频-语言理解、时间局部化、手部-物体交互和错误检测任务中分别至少高出 6.66%、21.81%、18.7% 和 3.00%。项目页面:https://yayuanli.github.io/MATT/
引用
@article{arxiv.2511.20525,
title = {Mistake Attribution: Fine-Grained Mistake Understanding in Egocentric Videos},
author = {Yayuan Li and Aadit Jain and Filippos Bellos and Jason J. Corso},
journal= {arXiv preprint arXiv:2511.20525},
year = {2026}
}
备注
12 pages, 5 figures, 7 tables. Accepted to CVPR 2026