增强复述类型生成:基于人类排序数据评估 DPO 与 RLHF 的影响
计算与语言
2025-06-04 v1
摘要
复述通过重新表达含义来增强文本简化、机器翻译和问答等应用。特定的复述类型有助于准确的语义分析和鲁棒的语言模型。然而,由于依赖自动化指标且缺乏人工标注的训练数据,现有的复述类型生成方法往往与人类偏好不一致,掩盖了语义保真度和语言转换的关键方面。本研究通过利用人类排序的复述类型数据集并集成直接偏好优化(DPO),使模型输出直接与人类判断对齐,从而填补了这一空白。基于 DPO 的训练使复述类型生成准确率比有监督基线提高了 3 个百分点,并使人类偏好评分提高了 7 个百分点。新创建的人工标注数据集为未来更严格的评估提供了支持。此外,复述类型检测模型在增加/删除、同极性替换和标点符号更改上的 F1 分数分别达到 0.91、0.78 和 0.70。这些发现表明,偏好数据和 DPO 训练能够产生更可靠、语义更准确的复述,从而支持改进摘要和更鲁棒的问答等下游应用。PTD 模型超越了自动化指标,为评估复述质量提供了更可靠的框架,推动复述类型研究向更丰富、更符合用户偏好的语言生成发展,并为基于以人为中心准则的未来评估奠定更坚实的基础。
引用
@article{arxiv.2506.02018,
title = {Enhancing Paraphrase Type Generation: The Impact of DPO and RLHF Evaluated with Human-Ranked Data},
author = {Christopher Lee Lübbers},
journal= {arXiv preprint arXiv:2506.02018},
year = {2025}
}
备注
21 pages, 11 figures. Master's thesis, University of Goettingen, December 2025. Code: https://github.com/cluebbers/dpo-rlhf-paraphrase-types. Models: https://huggingface.co/collections/cluebbers/enhancing-paraphrase-type-generation-673ca8d75dfe2ce962a48ac0