PANDA:用于增强大语言模型领域特定能力的偏好自适应
计算与语言
2024-06-19 v2 人工智能
摘要
虽然大语言模型 (LLMs) 在各种自然语言任务中展示了相当大的能力,但它们往往达不到领域特定最先进模型的性能水平。增强 LLMs 领域特定能力的一种潜在方法是使用相应的数据集对其进行微调。然而,这种方法既耗费资源又耗时,且不适用于闭源商业 LLMs。在本文中,我们提出了用于增强大语言模型领域特定能力的偏好自适应 (PANDA),这是一种旨在通过利用专家模型的响应偏好洞察来增强 LLMs 领域特定能力的方法,且无需微调。我们的实验结果表明,PANDA 显著增强了 LLMs 在文本分类和交互式决策任务上的领域特定能力。此外,带有 PANDA 的 LLM 甚至在 ScienceWorld 的 4 个任务上优于经过学习的专家模型。这一发现突显了探索无需微调的方法以实现弱到强泛化的潜力。
引用
@article{arxiv.2402.12835,
title = {PANDA: Preference Adaptation for Enhancing Domain-Specific Abilities of LLMs},
author = {An Liu and Zonghan Yang and Zhenhe Zhang and Qingyuan Hu and Peng Li and Ming Yan and Ji Zhang and Fei Huang and Yang Liu},
journal= {arXiv preprint arXiv:2402.12835},
year = {2024}
}
备注
Accepted as Findings of ACL 2024