中文

利用多奖励蒸馏定制自合理化模型

计算与语言 2024-05-24 v2

摘要

大语言模型(LM)能够生成自由文本理由以辅助问答。然而,先前工作1)表明有用的自合理化仅在相当规模下才涌现(例如175B参数的GPT-3);2)主要关注下游性能,忽略了理由本身的语义,例如它们是否忠实、真实且对人类有帮助?在本工作中,我们使小规模LM(约为GPT-3的1/200)生成不仅能提升下游任务性能,而且在可信性、一致性和多样性方面更优的理由,并通过自动与人工评估加以验证。我们的方法MaRio(Multi-rewArd RatIOnalization,多奖励条件化自合理化算法)是一种多奖励条件化的自合理化算法,可优化如可信性、多样性和一致性等多个不同属性。在StrategyQA、QuaRel、OpenBookQA、NumerSense和QASC五个困难问答数据集上的结果表明,MaRio不仅提升了任务准确率,还比有监督微调(SFT)基线更好地改善了小规模LM在上述维度上的自合理化质量。大量人工评估证实,相较于SFT理由,MaRio理由更受偏好,且在可信性和一致性上有定性提升。

关键词

引用

@article{arxiv.2311.02805,
  title  = {Tailoring Self-Rationalizers with Multi-Reward Distillation},
  author = {Sahana Ramnath and Brihi Joshi and Skyler Hallinan and Ximing Lu and Liunian Harold Li and Aaron Chan and Jack Hessel and Yejin Choi and Xiang Ren},
  journal= {arXiv preprint arXiv:2311.02805},
  year   = {2024}
}