中文

Relic:利用少样本示例增强低资源印度语奖励模型的泛化能力

计算与语言 2025-06-23 v1 人工智能

摘要

奖励模型对于将大语言模型(LLM)与人类偏好对齐至关重要。然而,大多数开源多语言奖励模型主要在高资源语言的偏好数据集上训练,导致对低资源印度语的奖励信号不可靠。为这些语言收集大规模、高质量的偏好数据成本高昂,使得基于偏好的训练方法不切实际。为应对这一挑战,我们提出了RELIC,一种用于低资源印度语奖励建模的新型上下文学习框架。RELIC训练一个带有成对排序目标的检索器,从辅助高资源语言中选择最能突出偏好与非偏好回答之间区别的上下文示例。在三个偏好数据集(PKU-SafeRLHF、WebGPT和HH-RLHF)上,使用最先进的开源奖励模型进行的大量实验表明,RELIC显著提高了低资源印度语的奖励模型准确性,持续优于现有的示例选择方法。例如,在博多语(一种低资源印度语)上,使用LLaMA-3.2-3B奖励模型,RELIC相比零样本提示和最先进的示例选择方法,准确率分别提升了12.81%和10.13%。

关键词

引用

@article{arxiv.2506.16502,
  title  = {Relic: Enhancing Reward Model Generalization for Low-Resource Indic Languages with Few-Shot Examples},
  author = {Soumya Suvra Ghosal and Vaibhav Singh and Akash Ghosh and Soumyabrata Pal and Subhadip Baidya and Sriparna Saha and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2506.16502},
  year   = {2025}
}