中文

基于CLIP语义对齐的Web规模多模态总结

机器学习 2026-02-17 v1 计算机视觉与模式识别 新兴技术 人机交互 神经与进化计算

摘要

我们提出Web规模多模态总结(Web-Scale Multimodal Summarization),这是一个轻量级框架,用于结合从Web来源检索的文本和图像数据生成总结。给定用户定义的主题,系统执行并行的Web搜索、新闻搜索和图像搜索。检索到的图像通过微调的CLIP模型进行排序,以衡量其与主题和文本之间的语义对齐程度。可选的BLIP描述生成可用于更强的多模态连贯性进行仅图像的总结。该管道支持可调的获取限制、语义过滤、总结风格以及下载结构化输出的功能。我们通过Gradio-based API公开系统,提供可控参数和预配置的配置。针对500个图像-文本对(带20:1对比负样本)的评估显示,ROC-AUC为0.9270,F1得分0.6504,准确率为96.99%,表明多模态对齐表现优异。本工作提供了一个可配置、可部署的工具,用于Web规模总结,将语言、检索和视觉模型集成到用户可扩展的管道中。

关键词

引用

@article{arxiv.2602.14889,
  title  = {Web-Scale Multimodal Summarization using CLIP-Based Semantic Alignment},
  author = {Mounvik K and N Harshit},
  journal= {arXiv preprint arXiv:2602.14889},
  year   = {2026}
}