中文

基于自动语音识别增强的跨域产品多模态表征学习

多媒体 2025-06-25 v2 人工智能 计算机视觉与模式识别

摘要

电子商务日益富含多媒体元素,产品以图像、短视频或直播推广等多种形式呈现。统一且矢量化的跨域产品表征对于实现跨域产品检索至关重要。鉴于大范围场景下产品内部差异大、产品间相似度高,仅依赖视觉表征已不足。虽然来自短视频或直播的自动语音识别(ASR)文本易于获取,但如何去噪过于嘈杂的文本以进行多模态表征学习却鲜有探讨。我们提出 ASR 增强型多模态产品表征学习框架(AMPere)。为从原始 ASR 文本中提取产品相关信息,AMPere 使用基于大语言模型的 ASR 文本概述器。该 LLM 概述的文本联合视觉数据输入到多分支网络,以生成紧凑的多模态嵌入。大规模三域数据集上的大量实验验证了 AMPere 在获取统一多模态产品表征方面的有效性,显著提升了跨域产品检索性能。

关键词

引用

@article{arxiv.2408.02978,
  title  = {ASR-enhanced Multimodal Representation Learning for Cross-Domain Product Retrieval},
  author = {Ruixiang Zhao and Jian Jia and Yan Li and Xuehan Bai and Quan Chen and Han Li and Peng Jiang and Xirong Li},
  journal= {arXiv preprint arXiv:2408.02978},
  year   = {2025}
}

备注

accepted for publication as a REGULAR paper in the IEEE Transactions on Multimedia