基于 CLIP 听者的语用推理用于对比描述生成
计算与语言
2023-06-16 v1
摘要
我们提出了一种简单而有效且鲁棒的方法用于对比描述生成:生成区分目标图像与非常相似的替代干扰图像的判断性描述。我们的方法建立在一个语用推理过程之上,该过程将描述生成形式化为说话者(产生描述目标的可能描述)与听者(给定描述选择目标)之间的指称游戏。与先前从单一描述生成模型推导说话者与听者分布的方法不同,我们利用现成的 CLIP 模型来参数化听者。与仅含描述器的语用模型相比,我们的方法在针对干扰项推理时受益于 CLIP 丰富的视觉语言对齐表示。如同先前用于判断性描述生成的方法,我们的方法使用超参数来控制信息性(描述多大可能使人类听者区分目标图像)与描述流畅性之间的权衡。然而,我们发现相较于过去的方法,我们的方法对该超参数的值显著更鲁棒,这使得我们能够自动将描述优化为信息性——在人类评估中以 11% 至 15% 的准确率优势超越过去的判断性描述生成方法。
引用
@article{arxiv.2306.08818,
title = {Pragmatic Inference with a CLIP Listener for Contrastive Captioning},
author = {Jiefu Ou and Benno Krojer and Daniel Fried},
journal= {arXiv preprint arXiv:2306.08818},
year = {2023}
}
备注
Findings of ACL 2023, fixed some references