通过消除子词赋能字符级文本填充
计算与语言
2024-06-17 v2 人工智能
摘要
在文本填充任务中,子词(即一个完整词被分割成两部分的情况)经常出现在前缀、中间部分和后缀的边界处。传统方法侧重于在词级别训练模型,导致在推理阶段的字符级填充任务中性能次优。另一种方法是考虑字符级填充,但它们在推理时依赖于预测子词,然而由于模型在子词上的高困惑度,这种策略削弱了字符级填充任务的能力。在本文中,我们引入了FIM-SE,即带有起始和结束字符约束的中间填充。所提出的方法通过利用行级格式来处理字符级填充任务,从而避免在推理中预测任何子词。此外,我们加入了两个特殊标记来表示不完整行的剩余部分,从而增强了生成引导。大量实验表明,我们的方法超越了先前的方法,具有显著优势。代码可在https://github.com/SenseLLM/FIM-SE获取。
引用
@article{arxiv.2405.17103,
title = {Empowering Character-level Text Infilling by Eliminating Sub-Tokens},
author = {Houxing Ren and Mingjie Zhan and Zhongyuan Wu and Hongsheng Li},
journal= {arXiv preprint arXiv:2405.17103},
year = {2024}
}
备注
Accepted to ACL 2024 (main conference)