EgoTV:基于自然语言任务描述的第一人称任务验证
计算机视觉与模式识别
2025-11-13 v6
摘要
为推进能够理解自然语言所指定日常任务的第一人称智能体研究,我们提出一个名为第一人称任务验证(Egocentric Task Verification,EgoTV)的基准与合成数据集。EgoTV 的目标是基于任务的自然语言描述,从第一人称视频中验证任务的执行。EgoTV 包含多步任务的图像对及其任务描述——这些任务含有多个子任务分解、状态变化、物体交互与子任务顺序约束。此外,EgoTV 还提供仅含完成任务部分细节的抽象任务描述。因此,EgoTV 需要视频与语言模态的因果、时序与组合推理,而这是现有数据集所缺失的。我们还发现现有视觉-语言模型在 EgoTV 所需的此类全方位推理上表现不佳。受 EgoTV 需求启发,我们提出一种新颖的神经-符号接地(Neuro-Symbolic Grounding,NSG)方法,利用符号表示捕捉任务的组合与时序结构。我们在 EgoTV 数据集与源自 CrossTask 的真实世界数据集(CTV)上展示了 NSG 在任务跟踪与验证上的能力。我们开源了 EgoTV、CTV 数据集与 NSG 模型,以惠及未来关于第一人称辅助智能体的研究。
引用
@article{arxiv.2303.16975,
title = {EgoTV: Egocentric Task Verification from Natural Language Task Descriptions},
author = {Rishi Hazra and Brian Chen and Akshara Rai and Nitin Kamra and Ruta Desai},
journal= {arXiv preprint arXiv:2303.16975},
year = {2025}
}
备注
Accepted at ICCV 2023