中文

重塑检索增强型个性化对话评估:从认知与语言学视角出发

计算与语言 2026-03-24 v2

摘要

在认知科学和语言学理论中,对话不被视为独立言语的链条,而是通过连贯性、一致性和共享理解维持的共同活动。然而,许多开放域和个性化对话系统在评估方法中仍以表层相似性指标(如BLEU、ROUGE、F1)作为主要报告措施,这些指标未能捕捉对话质量的深层方面。我们以检索增强型对话框架LAPDOG为案例研究,重新审视其评估方法。通过人类和LLM-based评判器,我们识别出当前评估实践的局限性,包括对话历史被破坏、检索的叙事与人格设定之间的矛盾,以及响应生成的不连贯性。我们的结果表明,人类和LLM判断高度一致,但与词汇相似性指标存在分歧,凸显了需要基于认知的评估方法。总体而言,本工作为检索增强型对话系统的可靠评估框架之路,更好地反映自然人类交流的原则。

关键词

引用

@article{arxiv.2603.14217,
  title  = {Rethinking Evaluation in Retrieval-Augmented Personalized Dialogue: A Cognitive and Linguistic Perspective},
  author = {Tianyi Zhang and David Traum},
  journal= {arXiv preprint arXiv:2603.14217},
  year   = {2026}
}