中文

ReFF:强化语言模型在多任务场景中的格式忠诚度

计算与语言 2024-12-13 v1

摘要

遵循格式指令生成结构化内容是大型语言模型(LLM)的一个基本且常被忽视的能力。为研究这一我们称为格式忠诚度的能力,我们提出了 FormatBench—a 一个全面的格式相关基准测试。与之前的格式相关基准测试相比,FormatBench 在应用场景(传统 NLP 任务、创意作品、自主代理任务)、人类-LLM 交互方式(单轮指令、多轮聊天)和格式类型(包含、包裹、长度、编码)方面具有更广泛的Variety。此外,FormatBench 的每个任务都附带一个格式检查程序。对基准测试的大规模实验表明,领先的开源和闭源 LLM 在格式忠诚度方面仍存在严重不足。凭借格式的可判定性,我们提出了强化格式忠诚度(ReFF)以帮助 LLM 按照指令生成格式化输出,同时不损害一般质量。无需任何标注数据,ReFF 可显著提高格式忠诚度(例如,从原始 LLaMA3 中的 21.6% 提升至 95.0% 在标题分割任务),同时保持一般质量(例如,从 47.3 提升至 46.4 的 F1 分数)。结合标注训练数据后,ReFF 能同时提高格式忠诚度(例如,从原始 LLaMA3 中的 21.6% 提升至 75.5%)和一般质量(例如,从 47.3 提升至 61.6 的 F1 分数)。我们进一步提供可解释性分析,以解释 ReFF 如何提高格式忠诚度和一般质量。

关键词

引用

@article{arxiv.2412.09173,
  title  = {ReFF: Reinforcing Format Faithfulness in Language Models across Varied Tasks},
  author = {Jiashu Yao and Heyan Huang and Zeming Liu and Haoyu Wen and Wei Su and Boao Qian and Yuhang Guo},
  journal= {arXiv preprint arXiv:2412.09173},
  year   = {2024}
}

备注

Accepted to AAAI 2025