上下文确实重要:对任务型对话系统众包评估标签的启示
计算与语言
2024-04-16 v1 人机交互
信息检索
摘要
众包标签在评估任务型对话系统方面发挥着至关重要的作用。从标注者处获取高质量且一致的真值标签面临诸多挑战。在评估 TDS 时,标注者必须在给出判断前充分理解对话。以往研究建议在标注过程中仅使用部分对话上下文。然而,这种限制对标签质量的影响尚未得到探讨。本研究考察了对话上下文对标注质量的影响,考虑了为相关性和有用性标注而截断上下文的情况。我们进一步提出使用大语言模型对对话上下文进行摘要,以提供对对话上下文丰富而简短的描述,并研究这样做对标注者表现的影响。减少上下文会导致更正面的评分。相反,提供完整对话上下文能产生更高质量的相关性评分,但在有用性评分中引入了模糊性。使用首个用户话语作为上下文能产生一致的评分,类似于使用完整对话获得的评分,同时显著减少了标注工作量。我们的发现展示了任务设计,特别是对话上下文的可用性,如何影响众包评估标签的质量和一致性。
引用
@article{arxiv.2404.09980,
title = {Context Does Matter: Implications for Crowdsourced Evaluation Labels in Task-Oriented Dialogue Systems},
author = {Clemencia Siro and Mohammad Aliannejadi and Maarten de Rijke},
journal= {arXiv preprint arXiv:2404.09980},
year = {2024}
}
备注
Accepted at NAACL 2024 Findings