DTO:一种用于有效反事实故事改写的可微训练目标
计算与语言
2026-05-26 v1
摘要
反事实故事改写是一种自然语言处理任务,需要更新现有故事以反映所选的备选事件,同时保持所有不受影响的情节元素及整体连贯性。虽然近期大型语言模型在此任务上取得了显著进展,但仍具有挑战性,因为所需修改通常在大小和局部性上都很小。因此,使用最大似然训练目标常规训练的模型容易忽略这些细微之处。与此同时,基于强化学习的更复杂训练方法 notoriously 缓慢且难以部署。鉴于此,我们提出一种新型可微训练目标(DTO),直接优化以实现反事实改进。我们的方法通过 end-to-end 反向传播微调 transformer 模型,其损失函数联合奖励:(i)与参考改写的忠实性;(ii)与源叙事的语义一致性。对 TimeTravel 和 ART 数据集进行经验评估,结果表明所提出的 DTO 方法在所有评估指标上均超过最大似然基线和基于偏好的方法,并在两个当代大型语言模型中表现出竞争力。这些发现印证了任务特定可微目标对细微、受控文本生成任务的有效性。
关键词
引用
@article{arxiv.2605.24885,
title = {DTO: a Differentiable Training Objective for Effective Counterfactual Story Rewriting},
author = {Amelia Girard and Massimo Piccardi},
journal= {arXiv preprint arXiv:2605.24885},
year = {2026}
}
备注
11 pages, 2 figures