中文

MADial-Bench:面向记忆增强对话生成的真实世界评估

计算与语言 2024-10-24 v2 人工智能

摘要

长期记忆对于聊天机器人和对话系统(DS)至关重要,以创建一致且符合人类的对话,已有大量开发的记忆增强型DS(MADS)出现。为了评估此类MADS的有效性,现有的常用评估指标,如检索准确率和困惑度(PPL),主要关注查询导向的事实性和语言质量评估。然而,这些指标常缺乏实际价值。此外,评估维度不足以进行人类化评估。关于记忆召回范式,当前的评估方案仅考虑被动记忆召回,忽略了基于认知科学和心理学理论构建的多样化记忆召回(例如情感和周围环境),而这些因素在情感支持场景中可能至关重要。为弥合这一差距,我们构建了一个覆盖各种记忆召回范式的新型记忆增强对话基准测试(MADail-Bench)。该基准分别评估两个任务:记忆检索和记忆识别,并纳入被动和主动记忆召回数据。我们引入新的评分标准,包括记忆注入、情感支持(ES)熟练度和亲密度,以全面评估生成的响应。来自 cutting-edge 嵌入模型和大型语言模型在此基准上的结果表明,仍有进一步提升的潜力。广泛测试进一步揭示了记忆注入、ES熟练度和亲密度之间的相关性。

关键词

引用

@article{arxiv.2409.15240,
  title  = {MADial-Bench: Towards Real-world Evaluation of Memory-Augmented Dialogue Generation},
  author = {Junqing He and Liang Zhu and Rui Wang and Xi Wang and Reza Haffari and Jiaxing Zhang},
  journal= {arXiv preprint arXiv:2409.15240},
  year   = {2024}
}

备注

Submitted to NAACL 2025