探究用于对话系统的训练度量指标的鲁棒性
人工智能
2022-03-01 v1 计算与语言
摘要
本文提出一种对抗方法来压力测试用于评估对话系统的训练度量指标。该方法利用强化学习(Reinforcement Learning)寻找能够从训练度量指标中获得最优分数的回复策略。我们将该方法应用于测试近期提出的训练度量指标。我们发现它们都容易对由相对简单且明显有缺陷的策略(我们的方法所收敛到的策略)生成的回复给出高分。例如,简单地复制对话上下文的部分内容来构成回复,就能获得有竞争力的分数,甚至优于人类撰写的回复。
引用
@article{arxiv.2202.13887,
title = {Probing the Robustness of Trained Metrics for Conversational Dialogue Systems},
author = {Jan Deriu and Don Tuggener and Pius von Däniken and Mark Cieliebak},
journal= {arXiv preprint arXiv:2202.13887},
year = {2022}
}