在A3DS上评估图像描述生成器的语用能力
计算与语言
2023-05-23 v1
摘要
在缺乏从人类收集的数据的情况下,评估具身神经语言模型在语用质量方面的表现——如生成话语的真实性、对比性与过度信息性之间的权衡——仍然是一项挑战。为支持此类评估,我们提出一个新的开源图文数据集“标注三维形状”(A3DS),包含超过九百万条穷尽式自然语言标注以及针对Burges & Kim (2018)所提供的480,000张图像的超过一千二百万条可变粒度描述。我们展示了对一个任务中立的图像描述生成器在多人通信设定下微调以产生对比性描述所发展出的语用能力的评估。该评估得以实现是因为穷尽式标注能够量化模型生成物中对比特征的存在。我们表明该模型发展出类人模式(信息性、简洁性、针对特定特征(如形状、颜色偏置)的过度信息性)。
引用
@article{arxiv.2305.12777,
title = {Evaluating Pragmatic Abilities of Image Captioners on A3DS},
author = {Polina Tsvilodub and Michael Franke},
journal= {arXiv preprint arXiv:2305.12777},
year = {2023}
}
备注
5 pages, 2 figures, to appear in the 61st Proceedings of the Association for Computational Linguistics (ACL 2023)