VaaWIT:面向多语言网页图像翻译的视觉感知适配大语言模型
计算机视觉与模式识别
2026-05-26 v1 人工智能
摘要
翻译嵌入Web图像中的文本对于提高内容可访问性和跨语言信息检索至关重要,尤其是在社交媒体和电子商务领域。尽管大规模视觉语言模型(LVLM)在多模态理解方面取得了进展,但将其应用于Web图像翻译仍面临挑战,主要是由于标准编码器倾向于优先考虑高层语义,而非识别多样字符形态所需的细粒度视觉细节。为此,我们提出VaaWIT,一个适用于多语言Web图像翻译的端到端框架。该框架引入两个关键技术贡献:首先,双流注意力模块(DSAM),促进多语言语义特征与详细视觉表征之间的双向交互,从而合成对文本变体稳健的统一特征;其次,视觉感知适配器(VAA),一种参数高效的微调策略,动态将这些融合视觉线索注入冻结的LLM主干。该设计使模型能够有效地将视觉上下文与语言推理对齐,同时最小化计算成本。广泛的在三个公开基准上的八个任务实验表明,VaaWIT在多个开源基线方法上均显著优于最先进(SOTA)方法,并与专有模型保持竞争力。这些结果验证了将细粒度视觉感知集成到LLM中以处理复杂Web内容分析的有效性。
引用
@article{arxiv.2605.24675,
title = {VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation},
author = {Bo Li and Ronghao Chen and Ningyuan Deng and Huacan Wang and Shaolin Zhu and Lijie Wen},
journal= {arXiv preprint arXiv:2605.24675},
year = {2026}
}
备注
Accepted by KDD 2026