中文

ActionCOMET:一种面向图像特定常识概念的零样学习方法

计算机视觉与模式识别 2024-10-18 v1

摘要

人类会观察他人执行各种动作(物理上或在视频/图像中),并能推导出他们肉眼不可见的各种推论。这些推论包括确定动作执行可能性的世界方面(例如液体对象可实现倒水),预测动作执行后世界变化的方式(例如土豆在炸制后变得金黄酥脆),以及与动作相关的高层次目标(例如打鸡蛋制作煎饼),以及推理可能 precede 或 follow 当前动作的动作(例如在搅打鸡蛋前掰开鸡蛋,或在煮面后沥干面水)。类似的推理能力对于开发能够帮助我们完成日常任务的自主系统而言是高度期望的。为此,我们提出了一个多模态任务,用于学习关于图像中所执行动作的上述概念。我们构建了一个由 8500 张图片和 59,300 条关于动作的推论组成的数据集,这些推论基于从标注的烹饪视频数据集中收集的图像。我们提出了 ActionCOMET,一个零样学习框架,用于从语言模型中辨识特定于提供的视觉输入所包含的知识。我们展示了在所收集的数据集上对 ActionCOMET 的基线结果,并将其与最佳现有 VQA 方法的性能进行比较。

关键词

引用

@article{arxiv.2410.13662,
  title  = {ActionCOMET: A Zero-shot Approach to Learn Image-specific Commonsense Concepts about Actions},
  author = {Shailaja Keyur Sampat and Yezhou Yang and Chitta Baral},
  journal= {arXiv preprint arXiv:2410.13662},
  year   = {2024}
}

备注

15 pages, 3 figures. arXiv admin note: text overlap with arXiv:2004.10796 by other authors