评估新闻缩略图代表性:反事实文本可增强跨模态匹配能力
计算与语言
2024-06-10 v3 计算机视觉与模式识别
摘要
本文探讨了评估新闻缩略图代表性这一关键挑战,当文章在社交媒体上传播时,缩略图通常是读者最先接触到的视觉内容。我们关注新闻图像是否代表了新闻文本中讨论的行为者。为应对这一挑战,我们引入了 NewsTT,一个包含 1000 对新闻缩略图与文本的人工标注数据集。我们发现,诸如 BLIP-2 等预训练视觉与语言模型在此任务上表现不佳。由于新闻主题通常涉及命名实体或专有名词,预训练模型在匹配新闻行为者的视觉与文本外观方面能力有限。我们假设,学习将新闻文本与其替换了命名实体的反事实文本进行对比,可以增强视觉与语言模型的跨模态匹配能力。我们提出了 CFT-CLIP,一个根据该假设更新视觉与语言双编码器的对比学习框架。我们发现,这种简单的方法能够提升评估新闻缩略图代表性的性能,从而支持了我们的假设。代码和数据可在 https://github.com/ssu-humane/news-images-acl24 获取。
引用
@article{arxiv.2402.11159,
title = {Assessing News Thumbnail Representativeness: Counterfactual text can enhance the cross-modal matching ability},
author = {Yejun Yoon and Seunghyun Yoon and Kunwoo Park},
journal= {arXiv preprint arXiv:2402.11159},
year = {2024}
}
备注
ACL 2024 (findings), 16 pages