通过大语言模型预测编辑操作以缩减序列长度
计算与语言
2023-10-24 v2
摘要
大语言模型(LLMs)已在多种任务中展现出卓越性能并受到广泛关注。LLMs 也被用于局部序列转换任务,包括语法错误纠正(GEC)与正式化风格转换,其中源文本大多数词元保持不变。然而,在此类任务中生成全部目标词元的模型倾向于直接照抄输入文本而不做所需修改,因为训练数据中输入与输出文本差异极小。这同样低效,因为 Transformer 的计算成本随目标序列长度呈二次增长。本文提出为局部序列转换任务预测源文本的编辑片段。以源文本位置与修正词元表示一个编辑片段,我们得以缩减目标序列长度及推理计算成本。我们对 LLMs 在编辑片段监督数据上应用指令微调。实验表明,尽管目标文本长度缩减少至 21%,所提方法在改写、正式化风格转换、GEC 与文本简化四项任务中仍取得与基线相当的性能。此外,我们报告采用所提方法的任务特定微调在四项任务中达到了最先进性能。
引用
@article{arxiv.2305.11862,
title = {Reducing Sequence Length by Predicting Edit Operations with Large Language Models},
author = {Masahiro Kaneko and Naoaki Okazaki},
journal= {arXiv preprint arXiv:2305.11862},
year = {2023}
}
备注
EMNLP2023