解锁结构度量:引入 PDD,一种用于位置话语连贯性的自动评估指标
计算与语言
2024-04-04 v2
摘要
最近的大语言模型 (LLM) 在各种任务中将生成文本与用户意图对齐方面表现出了卓越的性能。对于长文本生成,从话语连贯性角度进行生成的兴趣日益增长。然而,现有的词汇或语义指标(如 BLEU、ROUGE、BertScore)无法有效捕捉话语连贯性。开发针对话语的自动评估方法以评估 LLM 的输出值得更多的关注和探索。在本文中,我们提出了一种新的自动指标,旨在量化两篇长篇文章之间的话语分歧。在来自代表性领域的三个数据集上进行的大量实验表明,我们的指标与人类偏好和 GPT-4 连贯性评估更加一致,优于现有的评估方法。
引用
@article{arxiv.2402.10175,
title = {Unlocking Structure Measuring: Introducing PDD, an Automatic Metric for Positional Discourse Coherence},
author = {Yinhong Liu and Yixuan Su and Ehsan Shareghi and Nigel Collier},
journal= {arXiv preprint arXiv:2402.10175},
year = {2024}
}
备注
Accepted by NAACL 2024 main conference