评估风格-个人化文本生成:挑战与方向
计算与语言
2025-10-16 v2
摘要
随着大型语言模型(LLM)涌现及其生成定制化输出的能力,风格-个人化文本生成——“write like me”——已成为 rapidly 发展的兴趣领域。然而,风格个人化高度具体、相对每个用户而言,且强烈依赖于实践语境,这使其独特且具有挑战性。尽管先前研究引入了用于该领域的基准和指标,但它们倾向于非标准化且存在已知局限性(例如与人类主体的较差相关性)。发现 LLM 未能很好地捕捉作者特定的风格,因而必须仔细审查这些指标。在本工作中,我们批判性地检验了该领域最常用的指标的有效性,如 BLEU、嵌入和 LLM 作为评判员。我们使用我们提出的风格判别基准进行评估,该基准跨越八个多样化写作任务,涵盖三个评估setting:领域判别、作者归属和 LLM 生成的个人化与非个人化判别。我们发现,采用多样化评估指标的集成 consistently 优于单一评估方法,我们通过提供如何可靠评估风格-个人化文本生成的指导。
引用
@article{arxiv.2508.06374,
title = {Evaluating Style-Personalized Text Generation: Challenges and Directions},
author = {Anubhav Jangra and Bahareh Sarrafzadeh and Silviu Cucerzan and Adrian de Wynter and Sujay Kumar Jauhar},
journal= {arXiv preprint arXiv:2508.06374},
year = {2025}
}