中文

EnDex:大规模对话吸引力评估

计算与语言 2022-10-25 v1

摘要

我们提出 EnDex,首个基于人类反应的对话吸引力评估模型。EnDex 在一个使用新颖远程监督框架整理的 8 万条基于 Reddit 的吸引力数据集(RED)上训练。吸引力是衡量 AI 对话系统高层质量并紧密反映实际用户体验的关键指标。然而,数据短缺加上吸引力抽象且宽泛的定义,使得开发自动度量具有挑战性。我们的工作背离使用合成负例训练二分类器的主流方法,转而提出一种利用人类反应反馈远程监督的解决方案。为支持 EnDex 度量的可靠性,我们提供了吸引力的理论基础、广泛的消融研究,以及在五个吸引力相关数据集上高相关性的经验证据。我们将在论文发表时发布代码、即用型 EnDex 模型以及大规模数据集以促进未来研究。

关键词

引用

@article{arxiv.2210.12362,
  title  = {EnDex: Evaluation of Dialogue Engagingness at Scale},
  author = {Guangxuan Xu and Ruibo Liu and Fabrice Harel-Canada and Nischal Reddy Chandra and Nanyun Peng},
  journal= {arXiv preprint arXiv:2210.12362},
  year   = {2022}
}