任务成功与对话质量的交互:面向任务的视觉对话中的深入评估
计算与语言
2021-03-23 v1
摘要
在指代性对话猜测游戏上训练模型时,通常依据任务成功率来挑选最佳模型。我们表明,在流行的端到端方法中,这种选择阻碍了模型学习生成语言更丰富的对话,因为语言能力的习得比学习猜测任务耗时更长。通过比较参与不同游戏(GuessWhat、GuessWhich和Mutual Friends)的模型,我们表明这种差异与模型和任务无关。我们探究了更好的语言质量是否以及何时能带来更高的任务成功率。我们表明,在GuessWhat中,若模型学会对训练集中不常出现的词进行接地、编码和解码,则其准确率可得到提升。
引用
@article{arxiv.2103.11151,
title = {The Interplay of Task Success and Dialogue Quality: An in-depth Evaluation in Task-Oriented Visual Dialogues},
author = {Alberto Testoni and Raffaella Bernardi},
journal= {arXiv preprint arXiv:2103.11151},
year = {2021}
}