过程性视频指令中的隐式论元预测
计算与语言
2025-05-28 v1 计算机视觉与模式识别
摘要
过程性文本帮助 AI 增强对上下文和动作序列的推理。将其转化为语义角色标注(SRL)通过识别诸如 {动词,什么,哪里/用什么} 的谓词-论元结构,提升了对各个步骤的理解。过程性指令高度省略,例如,将黄瓜加入碗中以及加入切片番茄,第二步的哪里论元是从上下文推断出的,指代黄瓜放置的位置。先前的 SRL 基准通常遗漏隐式论元,导致理解不完整。为解决此问题,我们引入了 Implicit-VidSRL,这是一个需要从多模态烹饪过程上下文信息中推断隐式和显式论元的数据集。我们提出的数据集对多模态模型的上下文推理进行了基准测试,要求通过食谱中的视觉变化进行实体追踪。我们研究了近期的多模态 LLM,并揭示了在给定动词的情况下,它们难以从多模态过程数据中预测什么和哪里/用什么的隐式论元。最后,我们提出了 iSRL-Qwen2-VL,与 GPT-4o 相比,它在什么-隐式语义角色上的 F1 分数实现了 17% 的相对提升,在哪里/用什么-隐式语义角色上实现了 14.7% 的相对提升。
引用
@article{arxiv.2505.21068,
title = {Predicting Implicit Arguments in Procedural Video Instructions},
author = {Anil Batra and Laura Sevilla-Lara and Marcus Rohrbach and Frank Keller},
journal= {arXiv preprint arXiv:2505.21068},
year = {2025}
}
备注
ACL 2025 Main