基于惯例预测的多模态 RAI 警戒线定制化
机器学习
2025-07-29 v1 计算与语言
计算机与社会
摘要
多模态警戒线必须有效地根据用户定义的政策过滤图像内容,识别可能包含仇恨内容、强化有害刻板印象、包含暴露内容或散布虚假信息的材料。然而,在实际应用中部署此类警戒线面临着显著挑战。用户通常需要多样化且高度可定制的政策,通常无法为每个自定义政策提供大量示例。因此,理想的警戒线应能够扩展到多个政策,并能够以最小的重新训练适应不断演变的用户标准。现有的微调方法通常以预定义政策为条件化预测,这限制了其对新政策的普遍性,或需要 extensive 重新训练以适应。相反,训练-free 方法在上下文长度有限方面受限,难以全面包含所有政策。为克服这些限制,我们提出将模型的判断条件化为“惯例”,即与给定输入相似的先前数据点的推理过程。通过利用惯例而非固定政策,我们的方法大大增强了警戒线的灵活性和适应性。本文引入一种批判-修订机制用于收集高质量惯例,并提出两种利用惯例进行稳健预测的策略。实验结果表明,我们的方法在 few-shot 和 full-dataset 场景中均优于先前方法,并在新政策上表现出卓越的泛化能力。
关键词
引用
@article{arxiv.2507.20503,
title = {Customize Multi-modal RAI Guardrails with Precedent-based predictions},
author = {Cheng-Fu Yang and Thanh Tran and Christos Christodoulopoulos and Weitong Ruan and Rahul Gupta and Kai-Wei Chang},
journal= {arXiv preprint arXiv:2507.20503},
year = {2025}
}
备注
Accepted to COLM 2025