中文

多语言FActScore分析

计算与语言 2024-07-01 v1

摘要

FActScore作为评估大型语言模型(LLM)生成的英文长文本事实性的指标已广受欢迎。然而,目前尚无研究探讨FActScore在其他语言中的行为。本文研究了多语言环境下FActScore四组件流水线中每个组件的局限性。我们为强多语言LLM生成的文本引入了一个新的FActScore数据集。我们的评估表明,LLM在事实提取和事实评分任务中表现出不同的行为。没有LLM能在不同资源水平的语言中产生一致且可靠的FActScore。我们还发现,知识源在估计FActScore的质量中起着重要作用。使用维基百科作为知识源可能会因其中低资源语言的覆盖范围有限而阻碍长文本的真实FActScore。我们还对知识源采用了三种缓解措施,最终改善了所有语言的FActScore估计。

关键词

引用

@article{arxiv.2406.19415,
  title  = {An Analysis of Multilingual FActScore},
  author = {Kim Trong Vu and Michael Krumdick and Varshini Reddy and Franck Dernoncourt and Viet Dac Lai},
  journal= {arXiv preprint arXiv:2406.19415},
  year   = {2024}
}