中文

ExPerT:有效且可解释的个性化长篇文本生成评估

计算与语言 2025-06-03 v2 人工智能 信息检索

摘要

对大型语言模型 (LLM) 生成的个性化文本进行评估具有挑战性,因为只有 LLM 的用户,即提示作者,才能可靠地评估输出,但跨研究重新召集相同个体几乎不可能。本文通过引入 ExPerT——一种可解释的参考基准评估框架来解决个性化文本生成的评估挑战。ExPerT 利用 LLM 从生成文本和参考文本中提取原子化元素及其证据,匹配这些元素,并根据内容和写作风格对其进行对齐评估——这两个要素在个性化文本生成中至关重要。此外,ExPerT 为评估过程的每一步生成详细的、细粒度的解释,从而增强了透明度和可解释性。我们的实验表明,ExPerT 在与人类判断对齐方面相较于当前最先进的文本生成评估方法实现了 7.2% 的相对提升。此外,人类评估者将对 ExPerT 解释的可用性评为 5 分中的 4.7 分,凸显了其在使评估决策更具可解释性方面的有效性。

关键词

引用

@article{arxiv.2501.14956,
  title  = {ExPerT: Effective and Explainable Evaluation of Personalized Long-Form Text Generation},
  author = {Alireza Salemi and Julian Killingback and Hamed Zamani},
  journal= {arXiv preprint arXiv:2501.14956},
  year   = {2025}
}