OSCaR:物体状态描述与状态变化表示
计算机视觉与模式识别
2024-04-04 v4 人工智能
计算与语言
机器学习
摘要
智能模型外推和理解物体状态变化的能力是人工智能研究中至关重要却极具挑战性的一面,特别是在现实场景中通过人类互动的视角来看。该任务涉及描述复杂的视觉环境、识别活跃物体以及解释通过语言传达的物体变化。传统方法将物体描述和状态变化检测孤立开来,仅提供了对动态环境的有限视角。此外,依赖少量符号词汇来表示变化限制了语言的表达能力。为应对这些挑战,本文引入了物体状态描述与状态变化表示(OSCaR)数据集和基准测试。OSCaR 包含来自各种第一人称视频集合的 14,084 个标注视频片段,涵盖近 1,000 个独特物体。它为评估多模态大语言模型(MLLMs)设立了新的测试平台。我们的实验表明,虽然 MLLMs 展现出一定的技能,但它们缺乏对物体状态变化的全面理解。该基准测试包含一个微调模型,尽管具备初步能力,但在准确性和泛化能力方面仍需显著改进,以有效理解这些变化。我们的代码和数据集可在 https://github.com/nguyennm1024/OSCaR 获取。
引用
@article{arxiv.2402.17128,
title = {OSCaR: Object State Captioning and State Change Representation},
author = {Nguyen Nguyen and Jing Bi and Ali Vosoughi and Yapeng Tian and Pooyan Fazli and Chenliang Xu},
journal= {arXiv preprint arXiv:2402.17128},
year = {2024}
}
备注
NAACL 2024