EcoAlign:面向高效 LVLM 对齐的经济学理性框架
人工智能
2026-03-17 v2
摘要
大型视觉语言模型 (LVLMs) 具备强大的推理能力,但却存在复杂的越狱漏洞。从根本上说,LVLMs 的对齐不仅是安全挑战,更是经济效率问题。当前的对齐方法在安全性、实用性和运营成本之间存在困难的权衡。 critically地 (Critically),仅关注最终输出(过程盲性)会浪费大量计算资源用于不安全的推理。这种缺陷允许有害推理通过善意的合理化来隐藏,从而规避简单的加性安全评分。为此,我们提出了 EcoAlign,一个在推理阶段的框架,将对齐重新定义为经济理性搜索,通过将 LVLM 视为有限理性代理人来实现。EcoAlign 渐进式地扩展思考图,并使用类似净现值 (net present value) 的前瞻函数对动作进行评分,该函数动态权衡预期安全性、实用性和成本与剩余预算之间的关系。为防止欺骗,通过最弱链条原则 (weakest-link principle) 强制执行路径安全性。在 3 个封闭源模型和 2 个开源模型上的 6 个数据集上的大量实验表明,EcoAlign 在更低的计算成本下匹配或超越了最先进的安全性和实用性,从而为稳健的 LVLM 对齐提供了原则且经济的路径。
引用
@article{arxiv.2511.11301,
title = {EcoAlign: An Economically Rational Framework for Efficient LVLM Alignment},
author = {Ruoxi Cheng and Haoxuan Ma and Teng Ma and Hongyi Zhang},
journal= {arXiv preprint arXiv:2511.11301},
year = {2026}
}