中文

Vectra:面向电商图像中机器翻译的视觉质量评估新指标、数据集与模型

计算机视觉与模式识别 2026-02-10 v1 人工智能

摘要

图像机器翻译(IIMT)驱动跨境电商业务产品列表,但现有研究聚焦机器翻译评估,而视觉渲染质量对用户参与度至关重要。当面对上下文密集的产品图像和多模态缺陷时,现有基于参考的指标(如SSIM、FID)缺乏可解释性,而模型评判方法缺乏基于领域的细粒度奖励信号。为弥合这一差距,我们引入Vectra,据称是首个无参考、由多模态大模型驱动的电商IIMT视觉质量评估框架。Vectra包含三个组成部分:(1)Vectra评分系统,将视觉质量分解为14个可解释维度,引入基于空间的缺陷面积比(DAR)量化以减少标注模糊性;(2)Vectra数据集,基于多样性感知采样自110万真实产品图像构建,包含2000个系统评估基准、3000个基于推理的标注用于指令调优以及3500个专家标注的偏好用于对齐与评估;(3)Vectra模型,参数为4B的多模态大模型,可生成定量评分及诊断性推理。实验表明,Vectra在人类排名相关性方面实现了最新进展,我模型在评分性能上超越了领先的多模态大模型,包括GPT-5和Gemini-3。该数据集和模型将在接受后公开。

关键词

引用

@article{arxiv.2602.07014,
  title  = {Vectra: A New Metric, Dataset, and Model for Visual Quality Assessment in E-Commerce In-Image Machine Translation},
  author = {Qingyu Wu and Yuxuan Han and Haijun Li and Zhao Xu and Jianshan Zhao and Xu Jin and Longyue Wang and Weihua Luo},
  journal= {arXiv preprint arXiv:2602.07014},
  year   = {2026}
}