基于自动语音识别增强的跨域产品多模态表征学习
多媒体
2025-06-25 v2 人工智能
计算机视觉与模式识别
摘要
电子商务日益富含多媒体元素,产品以图像、短视频或直播推广等多种形式呈现。统一且矢量化的跨域产品表征对于实现跨域产品检索至关重要。鉴于大范围场景下产品内部差异大、产品间相似度高,仅依赖视觉表征已不足。虽然来自短视频或直播的自动语音识别(ASR)文本易于获取,但如何去噪过于嘈杂的文本以进行多模态表征学习却鲜有探讨。我们提出 ASR 增强型多模态产品表征学习框架(AMPere)。为从原始 ASR 文本中提取产品相关信息,AMPere 使用基于大语言模型的 ASR 文本概述器。该 LLM 概述的文本联合视觉数据输入到多分支网络,以生成紧凑的多模态嵌入。大规模三域数据集上的大量实验验证了 AMPere 在获取统一多模态产品表征方面的有效性,显著提升了跨域产品检索性能。
引用
@article{arxiv.2408.02978,
title = {ASR-enhanced Multimodal Representation Learning for Cross-Domain Product Retrieval},
author = {Ruixiang Zhao and Jian Jia and Yan Li and Xuehan Bai and Quan Chen and Han Li and Peng Jiang and Xirong Li},
journal= {arXiv preprint arXiv:2408.02978},
year = {2025}
}
备注
accepted for publication as a REGULAR paper in the IEEE Transactions on Multimedia