一种从图像生成电商文本列表的多模态多任务系统
机器学习
2025-10-28 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
手动生成吸引人的描述和名称对零售商来说既费时又费力。尽管生成式AI以视觉到语言模型(VLM)的形式提供了自动化解决方案,但当前的VLM容易产生事实性“幻觉”。孤立的单任务模型不仅效率低下,而且无法捕捉特征之间的相互依赖关系。为应对这些挑战,我们提出了一种端到端的多任务系统,该系统能从单张图像生成基于事实的文本列表。本研究的贡献在于提出了两种模型架构方案。首先,应用多任务学习方法微调视觉编码器,其中单个视觉骨干网络在属性预测(如颜色、下摆和领型)和价格回归上进行联合训练。其次,引入分层生成过程,将模型自身预测的属性嵌入提示中,并馈送给文本解码器,以提高事实一致性。实验证明了该架构的优越性。多任务方法在独立价格回归(R²值提升3.6%)和属性分类(F1分数提升6.6%)上均表现更优。关键的是,分层生成过程被证明非常有效,将事实性幻觉率从12.7%降至7.1%,相对降低了44.5%,相较于非分层消融实验。与类似规模的直接视觉到语言模型相比,分层方法还将自回归文本生成过程的延迟降低了3.5倍。一个小的注意事项是,该模型在ROUGE-L分数上比直接视觉到语言模型差3.5%。
引用
@article{arxiv.2510.21835,
title = {A Multimodal, Multitask System for Generating E Commerce Text Listings from Images},
author = {Nayan Kumar Singh},
journal= {arXiv preprint arXiv:2510.21835},
year = {2025}
}
备注
24 pages, 10 figures, 11 tables. Code can be found at: https://github.com/SinghNayanKumar/multimodal-product-lister/