多模态模型中的非对称特征
计算机视觉与模式识别
2026-02-27 v1
摘要
本 work 研究了标题模型及其对文本到图像模型的下游影响。我们设计了一套系统化分析方法:给定生成的标题或相应的图像,训练神经网络以预测来源标题模型。我们的结果显示,文本分类准确率非常高(99.70%),表明标题模型嵌入了独特的风格特征。相比之下,这些特征在生成图像中大部分消失,分类准确率最多仅为50%(即使针对最先进的Flux模型)。为更好地理解这种跨模态差异,我们进一步分析数据,发现生成图像未能保留标题中存在的关键变化,如细节水平、颜色和纹理的强调程度,以及场景中物体的分布。总体而言,我们的基于分类的框架提供了一种新方法,用于量化标题模型的风格特征以及文本到图像系统的提示跟随能力。
引用
@article{arxiv.2602.22734,
title = {Asymmetric Idiosyncrasies in Multimodal Models},
author = {Muzi Tao and Chufan Shi and Huijuan Wang and Shengbang Tong and Xuezhe Ma},
journal= {arXiv preprint arXiv:2602.22734},
year = {2026}
}
备注
Project page: https://muzi-tao.github.io/asymmetric-idiosyncrasies/