对齐任何内容:通过语言反馈训练全模态模型以遵循指令
摘要
强化学习从人类反馈(RLHF)已被证明在增强大型语言模型的指令遵循能力方面非常有效;然而,在跨模态领域仍未得到广泛探索。随着模态数量的增加,与人类意图(如指令遵循)对齐所有模态模型成为一个迫切的挑战。本文首次尝试使用跨模态的人类偏好数据,对所有模态模型(即输入和输出均可为任何模态,亦称任何到任何模型)进行微调,以确保其行为与人类意图相匹配。这一努力带来了若干挑战。首先,现有开源资源中缺乏大规模的所有模态人类偏好数据,因为大多数数据集仅限于特定模态,主要为文本和图像。其次,二进制偏好在RLHF中用于后训练对齐在复杂的所有模态场景中的有效性尚未得到探索。最后,缺乏系统性框架来评估所有模态模型的能力,尤其是关于模态选择和协同方面。在解决这些挑战方面,我们提出了align-anything框架,包括精心标注的20万条所有模态人类偏好数据。然后,我们引入一种从统一语言反馈中学习的方法,有效捕捉复杂的模态特定人类偏好,增强模型的指令遵循能力。此外,为了评估后训练对齐后所有模态模型的性能改进,我们构建了一个具有挑战性的全模态能力评估框架——eval-anything。所有数据、模型和代码框架已开源供社区使用。更多细节请参见https://github.com/PKU-Alignment/align-anything。
引用
@article{arxiv.2412.15837,
title = {Traffic-Rule-Compliant Trajectory Repair via Satisfiability Modulo Theories and Reachability Analysis},
author = {Yuanfei Lin and Zekun Xing and Xuyuan Han and Matthias Althoff},
journal= {arXiv preprint arXiv:2412.15837},
year = {2025}
}
备注
2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works