MULTITEXTEDIT:图像文本编辑中的跨语言退化基准测试
计算机视觉与模式识别
2026-05-19 v2 人工智能
计算与语言
摘要
图像文本编辑已成为视觉内容创作的关键能力,然而现有的基准测试仍然以英语为中心,并且常常将视觉合理性与语义正确性混为一谈。我们提出了 MULTITEXTEDIT,这是一个受控基准测试,包含 3600 个实例,涵盖 12 种类型多样的语言、5 个视觉领域和 7 种编辑操作。每个实例的语言变体共享一个共同的视觉基础,并与人工编辑的参考图像和区域掩码配对,从而隔离语言变量以进行跨语言比较。为了捕捉粗略的文本匹配指标无法发现的文字层面错误,例如缺失变音符号、反转的从右到左顺序以及混合文字渲染,我们引入了一个语言保真度 (LSF) 指标,该指标由两阶段 LVM 协议评分,该协议首先追踪编辑后的目标文本,然后单独对其进行判断,与母语标注者相比,达到了 0.76 的二次加权 kappa 系数。我们使用 LSF 以及标准的语义和掩码感知像素指标评估了 12 个开源和专有系统,发现每个模型都存在明显的跨语言退化,在希伯来语和阿拉伯语上退化最严重,在荷兰语和西班牙语上退化最小,并且退化集中在文本准确性和文字保真度上,而不是粗略的结构维度上。我们还发现了一种普遍存在的语义和像素不匹配现象,即输出保留了全局布局和背景保真度,但扭曲了特定文字的形式。
引用
@article{arxiv.2605.08163,
title = {MULTITEXTEDIT: Benchmarking Cross-Lingual Degradation in Text-in-Image Editing},
author = {Liwei Cheng and Shibo Feng and Lunjie Zhou and Yixuan Guan and Dayan Guan},
journal= {arXiv preprint arXiv:2605.08163},
year = {2026}
}
备注
11 pages, 5 figures