基于大语言模型从动作中学习多物体状态
计算机视觉与模式识别
2024-11-08 v2
摘要
在视频中识别物体状态对于理解超越动作和物体本身的场景至关重要。例如,在煎蛋卷时,鸡蛋可以是生的、破裂的和搅打过的,这些状态可以同时共存(鸡蛋可以既是生的又是搅打过的)。然而,现有大多数研究假设单一的物体状态变化(例如,未破裂 -> 破裂),忽略了多物体状态的共存特性以及过去状态对当前状态的影响。我们将物体状态识别表述为一个显式处理多种状态的多标签分类任务。然后,我们提出通过利用大语言模型(LLM)从转录的旁白中生成伪标签,从旁白视频中学习多物体状态,以捕捉过去状态的影响。挑战在于,旁白大多描述视频中的人类动作,但很少解释物体状态。因此,我们利用 LLM 关于动作与状态之间关系的知识来推导缺失的物体状态。我们进一步累积推导出的物体状态以考虑过去的状态上下文,从而推断当前的物体状态伪标签。我们新收集了一个名为多物体状态转换(MOST)的数据集,其中包含用于评估的手动多标签标注,涵盖六个物体类别的 60 种物体状态。实验结果表明,我们在 LLM 生成的伪标签上训练的模型显著优于强大的视觉-语言模型,证明了我们通过 LLM 考虑过去上下文的伪标签框架的有效性。
引用
@article{arxiv.2405.01090,
title = {Learning Multiple Object States from Actions via Large Language Models},
author = {Masatoshi Tateno and Takuma Yagi and Ryosuke Furuta and Yoichi Sato},
journal= {arXiv preprint arXiv:2405.01090},
year = {2024}
}
备注
This is an accepted WACV 2025 paper. Project page: https://masatate.github.io/ObjStatefromAction.github.io/