中文

自监督相互信息对齐的多任务设置探索

计算与语言 2025-06-06 v2

摘要

对于能够引导语言模型向 individual 属性和偏好方面的多样化对齐方法需求日益增长。其中一种方法,即基于相互信息的自监督对齐 (SAMI),使用条件相互信息来鼓励行为偏好与模型响应之间的联系。我们进行了两个实验,探索 SAMI 在多任务设置中的应用。首先,我们将 SAMI 与直接偏好优化 (DPO) 在多任务基准(MT-Bench)上进行比较,使用更强大的模型在多样化类别(人文科学、STEM、提取、编码、数学、推理和角色扮演)中为较弱的模型生成训练数据。我们的结果表明,SAMI 的一次迭代在 DPO 中以 57% 的胜率,各任务类别之间的性能存在显著差异。其次,我们检验了 SAMI 对数学准确率(GSM-8K)的影响,与监督微调 (SFT) 进行比较。虽然 SAMI 将零样本性能提升 1.1%,但 SFT 更有效,提升 3.2%。然而,SAMI 显示出有趣的扩展趋势。当给定 10 次尝试时,SAMI 将准确率提高 3.9%,而 SFT 实现 10.1% 的提升。将 SAMI 与 SFT 组合可在多次尝试设置中实现额外提升 1.3%,尽管单次尝试的准确率保持不变。

关键词

引用

@article{arxiv.2410.01704,
  title  = {An Exploration of Self-Supervised Mutual Information Alignment for Multi-Task Settings},
  author = {Soham V. Govande},
  journal= {arXiv preprint arXiv:2410.01704},
  year   = {2025}
}