如何正确地犯错:面向构建与基准测试的误知感知化 egocentric 程序视频框架
计算机视觉与模式识别
2026-04-17 v1
摘要
可靠的视频程序监控需要接触自然发生的人类错误及其随后出现的恢复情况。在 egocentric 记录中,错误常常被手部部分遮挡,通过细微的物体状态变化来揭示,而现有的程序数据集提供的错误和纠正痕迹有限且不一致。我们提出了 PIE-V(Psychologically Inspired Error injection for Videos,心理学启发的视频错误注入),用于构建和基准测试误知感知化 egocentric 程序视频的框架,通过向干净的关键步骤程序注入受控且符合人类合理性的偏差来实现。PIE-V 结合了基于程序阶段和语义步骤负荷的心理学信息化错误规划器、建模恢复行为的纠正规划器、执行级联一致性改写的 LLM 编写器,以及用于验证程序连贯性并修复失败的 LLM 判官。对于视频片段编辑,PIE-V 通过文本引导的视频生成合成替换片段并拼接到剧集中以保持视觉合理性。应用于 17 项任务和 50 个 Ego-Exo4D 场景,PIE-V 注入 102 处错误并生成 27 处恢复纠正。For benchmarking,我们引入了统一的分类法和包含步骤级和程序级质量的九项指标的人类评估标准,包括合理性、程序逻辑(带评估者置信度)、状态变化连贯性以及文本与视频之间的对应关系。使用该协议,我们审计了几个现有资源,并在相同标准下将 PIE-V 与自由形式 LLM 生成基线进行比较。总的来说,框架和评估标准支持 egocentric 程序错误检测与纠正的后完成验证。
引用
@article{arxiv.2604.15134,
title = {How to Correctly Make Mistakes: A Framework for Constructing and Benchmarking Mistake Aware Egocentric Procedural Videos},
author = {Olga Loginova and Frank Keller},
journal= {arXiv preprint arXiv:2604.15134},
year = {2026}
}