中文

LLM设计的奖励函数在多语言情境下的多样性:对任务性能与公平性的影响

计算与语言 2025-01-24 v1 人工智能 机器学习 多智能体系统

摘要

放松多臂赌博机(RMABs)已成功应用于多种场景的资源分配问题,包括公共卫生。随着强大大语言模型(LLMs)的快速发展,人们日益依赖它们来设计奖励函数,以更好地匹配人类偏好。最近的研究表明,LLMs可用于利用语言提示为社区需求定制自动化分配决策。然而,这些研究主要针对英文提示,且仅关注任务性能。这可能是一个问题,因为草根工作者,尤其是在印度等发展中国家,更倾向于使用当地语言,而这些语言可能属于资源较少的语言。此外,鉴于问题的性质,沿着人口群体的偏见也是不可取的。在本文中,我们研究了在非英文语言命令下使用DLM算法(最近一项利用LLMs为RMAB设计奖励函数的工作)时,对任务性能和公平性的影响。具体而言,我们在合成环境中对各种翻译成多种语言的提示进行测试。这些提示在复杂度上各不相同。我们的结果表明,LLM提议的奖励函数在英文提示下性能显著优于其他语言。我们还发现,提示的具体表述会影响任务性能。此外,随着提示复杂度的增加,所有语言的性能都会下降;然而,英文提示比低资源语言更具鲁棒性。在公平性方面,我们发现,低资源语言和更复杂的提示都高度可能在意外维度上造成不公平。

关键词

引用

@article{arxiv.2501.13120,
  title  = {Multilinguality in LLM-Designed Reward Functions for Restless Bandits: Effects on Task Performance and Fairness},
  author = {Ambreesh Parthasarathy and Chandrasekar Subramanian and Ganesh Senrayan and Shreyash Adappanavar and Aparna Taneja and Balaraman Ravindran and Milind Tambe},
  journal= {arXiv preprint arXiv:2501.13120},
  year   = {2025}
}

备注

Accepted at the AAAI-2025 Deployable AI Workshop