基于CLIP语义对齐的Web规模多模态总结
机器学习
2026-02-17 v1 计算机视觉与模式识别
新兴技术
人机交互
神经与进化计算
摘要
我们提出Web规模多模态总结(Web-Scale Multimodal Summarization),这是一个轻量级框架,用于结合从Web来源检索的文本和图像数据生成总结。给定用户定义的主题,系统执行并行的Web搜索、新闻搜索和图像搜索。检索到的图像通过微调的CLIP模型进行排序,以衡量其与主题和文本之间的语义对齐程度。可选的BLIP描述生成可用于更强的多模态连贯性进行仅图像的总结。该管道支持可调的获取限制、语义过滤、总结风格以及下载结构化输出的功能。我们通过Gradio-based API公开系统,提供可控参数和预配置的配置。针对500个图像-文本对(带20:1对比负样本)的评估显示,ROC-AUC为0.9270,F1得分0.6504,准确率为96.99%,表明多模态对齐表现优异。本工作提供了一个可配置、可部署的工具,用于Web规模总结,将语言、检索和视觉模型集成到用户可扩展的管道中。
引用
@article{arxiv.2602.14889,
title = {Web-Scale Multimodal Summarization using CLIP-Based Semantic Alignment},
author = {Mounvik K and N Harshit},
journal= {arXiv preprint arXiv:2602.14889},
year = {2026}
}