基于 LLM 链式思考的可解释文本到视频检索:X-CoT
计算机视觉与模式识别
2025-12-23 v1
摘要
主流文本到视频检索系统主要采用嵌入模型进行特征提取并计算余弦相似度进行排序。然而,这种设计存在两个局限:低质量的文本-视频配对可能影响检索效果,却难以识别和检查;仅依赖余弦相似度无法提供排序结果的解释,限制了可解释性。我们提出 X-CoT,一种基于 LLM 链式思考的可解释检索框架,取代嵌入模型驱动的相似度排序。我们首先扩展现有基准,添加额外的视频标注以支持语义理解并减少数据偏差。我们还构建了一个检索链式思考框架,包含两两比较步骤,生成详细的推理过程和完整的排序。X-CoT 实证性地提升了检索性能,并产生详尽的论述。它还促进了模型行为和数据质量分析。代码和数据已公开于:https://github.com/PrasannaPulakurthi/X-CoT。
引用
@article{arxiv.2509.21559,
title = {X-CoT: Explainable Text-to-Video Retrieval via LLM-based Chain-of-Thought Reasoning},
author = {Prasanna Reddy Pulakurthi and Jiamian Wang and Majid Rabbani and Sohail Dianat and Raghuveer Rao and Zhiqiang Tao},
journal= {arXiv preprint arXiv:2509.21559},
year = {2025}
}
备注
12 pages, 7 figures. Accepted at EMNLP 2025 (Main Conference)