中文

基于大语言模型的个性化文本生成自动评估

计算与语言 2023-10-19 v1 人工智能 机器学习

摘要

个性化文本生成提供了一种针对用户个人上下文交付特定内容的专门机制。尽管该领域的研究进展迅速,但评估仍是一项挑战。BLEU 和 ROUGE 等传统自动指标主要衡量与人类撰写参考文本的词汇相似度,无法将个性化与其他细微语义方面区分开来,因而难以捕捉个性化生成内容质量的细微差别。另一方面,人工判断的获取成本高昂,尤其在个性化评估领域。受这些挑战启发,我们探索使用大语言模型(LLM)评估个性化文本生成,并考察其理解细微用户上下文的能力。我们提出 AuPEL,一种新颖的评估方法,提炼生成文本的三个主要语义方面:个性化、质量与相关度,并自动衡量这些方面。为验证 AuPEL 的有效性,我们设计了精心控制的实验,比较 LLM 与人工标注者所作评估判断的准确性,并对所提指标的一致性与敏感性进行严格分析。我们发现,与现有评估指标相比,AuPEL 不仅能更准确地依据个性化能力区分和排序模型,而且在该任务上展现出值得称道的一致性与效率。我们的工作表明,使用 LLM 作为个性化文本生成的评估者优于传统文本相似度指标,尽管仍有有趣的新挑战存在。

关键词

引用

@article{arxiv.2310.11593,
  title  = {Automated Evaluation of Personalized Text Generation using Large Language Models},
  author = {Yaqing Wang and Jiepu Jiang and Mingyang Zhang and Cheng Li and Yi Liang and Qiaozhu Mei and Michael Bendersky},
  journal= {arXiv preprint arXiv:2310.11593},
  year   = {2023}
}