LUST:基于分层LLM评分的多模态学习主题重要性跟踪框架
多媒体
2025-08-07 v1 人工智能
摘要
本文介绍了已学习用户重要性跟踪器(LUST),该框架旨在分析视频内容并量化其片段与用户提供的文本描述相关性。LUST利用多模态分析管道,将视频帧中的视觉线索与通过自动语音识别(ASR)从音频轨道中提取的文本信息相结合。核心创新在于采用大型语言模型(LLM)的分层双阶段相关性评分机制。首先,“直接相关性”分数基于主题对单个片段进行即时视觉和听觉内容的评估;随后,“情境相关性”分数通过纳入前导主题分数的时序进程来细化评估,使模型能够理解演变中的叙事。LUST框架旨在提供一种细致的、时序感知的用户定义重要性度量,输出带有可视化相关性分数和综合分析日志的标注视频。
引用
@article{arxiv.2508.04353,
title = {LUST: A Multi-Modal Framework with Hierarchical LLM-based Scoring for Learned Thematic Significance Tracking in Multimedia Content},
author = {Anderson de Lima Luiz},
journal= {arXiv preprint arXiv:2508.04353},
year = {2025}
}
备注
5 pages and 4 figures