Conformal Alignment:以保证准则识别何时值得信赖基础模型
机器学习
2024-11-06 v3 人工智能
机器学习
摘要
在将基础模型的输出部署到高风险任务前,必须确保其与人类价值观保持一致。例如,在放射学报告生成中,由视觉语言模型生成的报告必须在用于医疗决策前与人类评估保持一致。本文提出Conformal Alignment框架,用于识别满足用户指定对齐准则的单元。我们保证,平均情况下,所选定的单元确实满足对齐准则,而不论基础模型或数据分布如何。给定任意预训练模型和新的带有模型生成输出的单元,Conformal Alignment利用一组具有真实对齐状态的参考数据来训练对齐预测器,然后选择其预测对齐得分超过数据依赖阈值的新单元, certify 其对应的输出可信。通过应用于问答和放射学报告生成,我们展示该方法能够通过对适度参考数据的轻量级训练准确识别输出可信的单元。在此过程中,我们探讨了各种特征在对齐预测中的信息性,并将其与标准模型结合以构建对齐预测器。
引用
@article{arxiv.2405.10301,
title = {Conformal Alignment: Knowing When to Trust Foundation Models with Guarantees},
author = {Yu Gui and Ying Jin and Zhimei Ren},
journal= {arXiv preprint arXiv:2405.10301},
year = {2024}
}