面向无参考摘要的信息论蒸馏
计算与语言
2024-08-21 v2 人工智能
摘要
当前自动摘要的成功秘诀是直接使用像ChatGPT这样的专有大规模语言模型(LLM),或通过模仿学习将其作为教师模型。虽然对这种大规模语言模型的日益普遍依赖很方便,但一个重要问题仍然存在:如果我们寻求一种替代学习方法——允许构建一个更具成本效益、可控性更强且功能强大的摘要器——小规模模型是否也能取得有竞争力的结果?我们提出了InfoSumm,这是一个新颖的框架,它基于信息论目标进行摘要蒸馏,既不依赖LLM的能力,也不依赖人工编写的参考摘要。为此,我们首先通过原始文档与摘要之间互信息的视角,提出了对摘要需求(显著性、忠实性和简洁性)的新颖表述。基于这一表述,我们从Pythia-2.8B开始作为教师模型,该模型尚不具备摘要能力,然后自训练该模型以优化理想摘要的信息中心度量。从改进后的教师模型进行蒸馏,我们得到了一个仅含568M参数的紧凑而强大的摘要器,其性能可与ChatGPT竞争,且从未依赖ChatGPT的能力。广泛的分析表明,我们的方法在人类评估中优于领域内监督模型,更不用说最先进的无监督方法,并且在可控摘要方面胜过ChatGPT。
引用
@article{arxiv.2403.13780,
title = {Information-Theoretic Distillation for Reference-less Summarization},
author = {Jaehun Jung and Ximing Lu and Liwei Jiang and Faeze Brahman and Peter West and Pang Wei Koh and Yejin Choi},
journal= {arXiv preprint arXiv:2403.13780},
year = {2024}
}