利用因果推断模型改进开放域对话评估
计算与语言
2023-02-01 v1 人工智能
摘要
有效的评估方法仍是开放域对话系统研究中的重大挑战。可以从用户处获取显式满意度评分,但用户被询问时往往不提供评分,且所给评分可能高度主观。专家事后评分是一种替代方案,但这类评分的收集既昂贵又复杂。在此,我们探索创建自动化方法以预测开放域对话的专家与用户评分。我们比较了四种不同方法。首先,我们训练了一个端到端 transformer 基线模型,直接从原始对话文本预测评分。其余三种方法是一种两阶段方法的变体:我们首先在轮次级别提取可解释特征,这些特征除其他方面外捕捉了表明矛盾、重复、无兴趣、称赞或批评的用户对话行为。我们将这些特征投影到对话级别,并训练了一个对话级 MLP 回归模型、一个对话级 LSTM,以及一种称为反事实 LSTM(counterfactual-LSTM, CF-LSTM)的新型因果推断模型来预测评分。所提出的 CF-LSTM 是一种基于轮次级特征的顺序模型,它根据由轮次级特征导出的假设使用多个回归器预测评分。作为因果推断模型,CF-LSTM 旨在学习特定事件(如低评分)的潜在原因。我们还将用户评分分箱,并用全部四种模型进行分类实验。在来自 Alexa Prize SocialBot 的对话数据评估实验中,我们表明 CF-LSTM 在预测对话评分和分类方面取得了最佳性能。
引用
@article{arxiv.2301.13372,
title = {Improving Open-Domain Dialogue Evaluation with a Causal Inference Model},
author = {Cat P. Le and Luke Dai and Michael Johnston and Yang Liu and Marilyn Walker and Reza Ghanadan},
journal= {arXiv preprint arXiv:2301.13372},
year = {2023}
}
备注
Accepted as a conference paper at IWSDS 2023