中文

本质与前景:大模型对齐方法探究

人工智能 2024-03-08 v1 计算与语言

摘要

大模型在 AI 领域取得了革命性突破,但也可能带来潜在担忧。为解决此类担忧,引入了对齐技术以使这些模型符合人类偏好和价值观。尽管过去一年取得了显著进展,但在建立最佳对齐策略方面仍存在诸多挑战,如数据成本和可扩展监督,且如何进行对齐仍是一个开放性问题。在这篇综述论文中,我们全面研究了价值对齐方法。我们首先追溯对齐的历史背景至 20 世纪 20 年代(其起源),然后深入探讨对齐的数学本质(其定义),揭示其固有挑战。在此基础上,我们详细考察了现有的对齐方法,将其分为三类:强化学习、监督微调和上下文学习,并展示了它们的内在联系、优势和局限性,以帮助读者更好地理解该研究领域。此外,我们还讨论了个人对齐和多模态对齐这两个新兴主题,作为该领域的新前沿。展望未来,我们讨论了潜在的对齐范式及其如何应对剩余挑战,并展望了对齐技术的未来发展方向。

关键词

引用

@article{arxiv.2403.04204,
  title  = {On the Essence and Prospect: An Investigation of Alignment Approaches for Big Models},
  author = {Xinpeng Wang and Shitong Duan and Xiaoyuan Yi and Jing Yao and Shanlin Zhou and Zhihua Wei and Peng Zhang and Dongkuan Xu and Maosong Sun and Xing Xie},
  journal= {arXiv preprint arXiv:2403.04204},
  year   = {2024}
}

备注

23 pages, 7 figures