中文

EcoAlign:面向高效 LVLM 对齐的经济学理性框架

人工智能 2026-03-17 v2

摘要

大型视觉语言模型 (LVLMs) 具备强大的推理能力,但却存在复杂的越狱漏洞。从根本上说,LVLMs 的对齐不仅是安全挑战,更是经济效率问题。当前的对齐方法在安全性、实用性和运营成本之间存在困难的权衡。 critically地 (Critically),仅关注最终输出(过程盲性)会浪费大量计算资源用于不安全的推理。这种缺陷允许有害推理通过善意的合理化来隐藏,从而规避简单的加性安全评分。为此,我们提出了 EcoAlign,一个在推理阶段的框架,将对齐重新定义为经济理性搜索,通过将 LVLM 视为有限理性代理人来实现。EcoAlign 渐进式地扩展思考图,并使用类似净现值 (net present value) 的前瞻函数对动作进行评分,该函数动态权衡预期安全性、实用性和成本与剩余预算之间的关系。为防止欺骗,通过最弱链条原则 (weakest-link principle) 强制执行路径安全性。在 3 个封闭源模型和 2 个开源模型上的 6 个数据集上的大量实验表明,EcoAlign 在更低的计算成本下匹配或超越了最先进的安全性和实用性,从而为稳健的 LVLM 对齐提供了原则且经济的路径。

关键词

引用

@article{arxiv.2511.11301,
  title  = {EcoAlign: An Economically Rational Framework for Efficient LVLM Alignment},
  author = {Ruoxi Cheng and Haoxuan Ma and Teng Ma and Hongyi Zhang},
  journal= {arXiv preprint arXiv:2511.11301},
  year   = {2026}
}