中文

对话机器人性能提升的对齐方法

机器学习 2024-06-28 v1 人工智能

摘要

本文表明,在对话代理(也称为机器人)中,对齐方法可以实现对预定义准则或'监禁线'的更好遵循,而仅通过指令微调则不行。这一研究检查了传统训练方法,如指令微调,以及最近的直接对齐方法,如身份偏好优化 (IPO) 和卡恩-范德西尔优化 (KTO)。结果强调了前后对齐技术的有效性,说明其在需要严格遵守指定规则的领域(如客户服务)优化对话机器人的潜力。

关键词

引用

@article{arxiv.2406.18954,
  title  = {Alignment For Performance Improvement in Conversation Bots},
  author = {Raghav Garg and Kapil Sharma and Shrey Singla},
  journal= {arXiv preprint arXiv:2406.18954},
  year   = {2024}
}