紧记风格间隙:风格与属性迁移指标的元评估
计算与语言
2025-09-18 v4
摘要
大型语言模型(LLM)使文本风格重写变得容易——例如,使其更礼貌、更有说服力或更积极,但对其评估并不 straightforward。一个挑战在于衡量内容保存:即不可归因于风格变化的内容是否被保留。本文对风格和属性迁移指标进行大规模元评估,关注内容保存。我们发现,针对现有数据集进行的元评估研究会导致关于指标是否适合内容保存的误导性结论。广泛使用的指标尽管被认为不适合该任务,却显示出与人类判断的高度相关性——因为它们在评估内容保存时未能抽象于风格变化。我们表明,尽管高度相关性来自测试数据的本质。为解决此问题,我们引入了一个新的、具有挑战性的数据集,专为评估风格迁移的内容保存指标而设计。我们通过在内容保存方面创建高变异性来构建该数据集。使用该数据集,我们证明了适合风格迁移内容保存的指标确实是风格感知的。为支持高效评估,我们提出了一种新的风格感知方法,该方法利用小型语言模型,比使用与自评估模型相同大小的模型进行提示更能与人类判断保持更高的对齐度。
引用
@article{arxiv.2502.15022,
title = {Mind the Style Gap: Meta-Evaluation of Style and Attribute Transfer Metrics},
author = {Amalie Brogaard Pauli and Isabelle Augenstein and Ira Assent},
journal= {arXiv preprint arXiv:2502.15022},
year = {2025}
}
备注
Accepted at EMNLP Findings 2025