中文

论奖励模型、参数更新和上下文提示之间的转换

计算与语言 2024-06-25 v1 人工智能

摘要

尽管预训练的大型语言模型(LLM)具有通用能力,但它们仍需进一步适配以更好地服务于实际应用。在本文中,我们展示了三种流行且不同的适配工具的可互换性:参数更新、奖励建模和上下文提示。这种可互换性建立了一个包含六个转换方向的三角框架,每个方向都促进了多种应用。我们的工作提供了一个统一的视角,将众多现有研究联系起来,并提出了潜在的研究方向。我们期望我们的工作能成为未来LLM研究的有用路线图。

关键词

引用

@article{arxiv.2406.16377,
  title  = {On the Transformations across Reward Model, Parameter Update, and In-Context Prompt},
  author = {Deng Cai and Huayang Li and Tingchen Fu and Siheng Li and Weiwen Xu and Shuaiyi Li and Bowen Cao and Zhisong Zhang and Xinting Huang and Leyang Cui and Yan Wang and Lemao Liu and Taro Watanabe and Shuming Shi},
  journal= {arXiv preprint arXiv:2406.16377},
  year   = {2024}
}