中文

面向设备端文本重写智能体的研究

计算与语言 2023-08-24 v1

摘要

大语言模型(LLM)已展现出令人印象深刻的文本重写能力。然而,这些模型的庞大尺寸使其不适用于设备端推理,而设备端推理原本可带来增强的隐私性和经济性推理。创建一个更小却强大的文本重写语言模型是一项艰巨挑战,因为这需要在小尺寸需求与保留LLM涌现能力需求之间取得平衡,而后者需要昂贵的数据收集。为应对上述挑战,我们引入了一种用于构建以移动端为中心的文本重写模型的新型指令微调方法。我们的策略能够在无需任何人工标注的情况下生成高质量训练数据。此外,我们提出了一种启发式强化学习框架,其在不需要偏好数据的情况下大幅提升了性能。为进一步弥合与更大服务端模型之间的性能差距,我们提出了一种通过级联将移动端重写智能体与服务端模型相结合的有效方法。为使文本重写任务贴合移动场景,我们引入了MessageRewriteEval,一个专注于通过自然语言指令进行消息文本重写的基准。通过实证实验,我们证明我们的设备端模型在文本重写方面超越了当前最先进的LLM,同时保持显著缩小的模型尺寸。值得注意的是,我们展示了所提出的级联方法提升了模型性能。

关键词

引用

@article{arxiv.2308.11807,
  title  = {Towards an On-device Agent for Text Rewriting},
  author = {Yun Zhu and Yinxiao Liu and Felix Stahlberg and Shankar Kumar and Yu-hui Chen and Liangchen Luo and Lei Shu and Renjie Liu and Jindong Chen and Lei Meng},
  journal= {arXiv preprint arXiv:2308.11807},
  year   = {2023}
}