交叉字幕:面向 MS-COCO 的扩展模态内与模态间语义相似度判断
计算与语言
2021-03-25 v3
摘要
通过支持多模态检索训练与评测,图像字幕数据集推动了表征学习的显著进展。遗憾的是,数据集的跨模态关联有限:图像未与其他图像配对,字幕仅与同一图像的其他字幕配对,没有负关联且存在缺失的正跨模态关联。这阻碍了关于模态间学习如何影响模态内任务的研究。我们以 Crisscrossed Captions(CxC)弥补这一缺口,它是 MS-COCO 数据集的扩展,包含 267,095 个模态内与模态间配对的人类语义相似度判断。我们报告了现有强单模态与多模态模型在 CxC 上的基线结果。我们还评估了一个在图像-字幕与字幕-字幕对上训练的多任务双编码器,其关键性地展示了 CxC 在度量模态内与模态间学习影响方面的价值。
引用
@article{arxiv.2004.15020,
title = {Crisscrossed Captions: Extended Intramodal and Intermodal Semantic Similarity Judgments for MS-COCO},
author = {Zarana Parekh and Jason Baldridge and Daniel Cer and Austin Waters and Yinfei Yang},
journal= {arXiv preprint arXiv:2004.15020},
year = {2021}
}
备注
To be presented at EACL2021