使用 PARADISE 建模开放域对话中的性能
计算与语言
2021-10-22 v1 人工智能
摘要
近来关于口语对话系统的研究大量涌现,同时人们对在电影、书籍和音乐等热门话题上进行随意交谈的开放域系统的兴趣也日益增加。这些系统旨在从社交层面吸引、娱乐甚至共情于其用户。由于此类社交目标的达成难以度量,近期研究使用对话长度或人工评分作为评价指标,并开发了自动计算连贯性、一致性、相关性和参与度等新指标的方法。在此,我们为 Athena 对话系统开发了一个 PARADISE 模型以预测其性能;Athena 曾作为 Alexa Prize 决赛选手与真实用户进行了数千次对话。我们同时使用用户评分和对话长度作为对话质量指标,并尝试利用系统依赖与系统独立这两类自动特征来预测这些指标。我们的目标是学习一个通用目标函数,可用于实时优化任意 Alexa Prize 系统的对话选择并评估其性能。我们预测用户评分的最佳模型使用 DistilBert 取得了 .136 的 R,而使用系统独立特征预测长度的最佳模型取得了 .865 的 R,这表明对话长度或许是训练对话系统更可靠的自动度量。
引用
@article{arxiv.2110.11164,
title = {Modeling Performance in Open-Domain Dialogue with PARADISE},
author = {Marilyn Walker and Colin Harmon and James Graupera and Davan Harrison and Steve Whittaker},
journal= {arXiv preprint arXiv:2110.11164},
year = {2021}
}
备注
The 12th International Workshop on Spoken Dialog System Technology, November 2021