DIVE: 迈向描述性与多样性的视觉常识生成
计算机视觉与模式识别
2024-08-16 v1 人工智能
摘要
面向人类级别的视觉理解,视觉常识生成被引入以生成超越图像的常识推理。然而,当前视觉常识生成研究忽视了一项重要的人类认知能力:生成描述性和多样性的推理。在本工作中,我们提出了一种新的视觉常识生成框架 DIVE,旨在提升生成推理的描述性和多样性。DIVE 涉及两种方法——通用推理过滤和对比检索学习——分别解决现有视觉常识资源和训练目标的局限性。实验结果验证了 DIVE 在描述性和多样性方面均优于最先进的视觉常识生成模型,同时在生成独特和新颖推理方面展现出优越质量。值得注意的是,DIVE 在视觉常识图上达到了人类级别的描述性和多样性。此外,人类评估确认 DIVE 在描述性和多样性方面与人类判断高度一致。
引用
@article{arxiv.2408.08021,
title = {DIVE: Towards Descriptive and Diverse Visual Commonsense Generation},
author = {Jun-Hyung Park and Hyuntae Park and Youjin Kang and Eojin Jeon and SangKeun Lee},
journal= {arXiv preprint arXiv:2408.08021},
year = {2024}
}
备注
19 pages, 10 figuers, EMNLP 2023 (main)