对话机器人性能提升的对齐方法
机器学习
2024-06-28 v1 人工智能
摘要
本文表明,在对话代理(也称为机器人)中,对齐方法可以实现对预定义准则或'监禁线'的更好遵循,而仅通过指令微调则不行。这一研究检查了传统训练方法,如指令微调,以及最近的直接对齐方法,如身份偏好优化 (IPO) 和卡恩-范德西尔优化 (KTO)。结果强调了前后对齐技术的有效性,说明其在需要严格遵守指定规则的领域(如客户服务)优化对话机器人的潜力。
引用
@article{arxiv.2406.18954,
title = {Alignment For Performance Improvement in Conversation Bots},
author = {Raghav Garg and Kapil Sharma and Shrey Singla},
journal= {arXiv preprint arXiv:2406.18954},
year = {2024}
}