中文

ALIVE:面向实时交互的内容感知式头像讲座视频引擎

计算机视觉与模式识别 2025-12-25 v1

摘要

传统讲座视频虽提供灵活性,却缺乏实时澄清机制,迫使学习者在困惑时需外部搜索。近期大语言模型和神经头像的进展提供了新的互动学习机会,但现有系统通常缺乏讲座意识、依赖云端服务,或未能在统一且隐私保护的管道中集成检索与头像交付式解释。我们提出 ALIVE(Avatar-Lecture Interactive Video Engine),将被动讲座观看转化为动态实时学习体验。ALIVE 在本地硬件上运行,集成(1)通过语音识别转录、LLM 优化和神经说话头像合成交付的讲座内容;(2)结合语义相似性和时间戳对齐的内容感知检索机制,以检索到上下文相关的讲座片段;(3)实时多模态交互,使学习者可暂停讲座、通过文本或语音提问,接收以文本或头像交付的就地解释。为保持响应性,ALIVE 采用轻量级嵌入模型、FAISS 检索和分段头像合成的渐进式预加载。我们在完整的医学影像课程上演示该系统,评估其检索准确率、延迟特性和用户体验,表明 ALIVE 提供准确、内容感知且富有吸引力的实时支持。ALIVE 说明了多模态 AI——结合内容感知检索和本地部署——如何显著提升录播讲座的教育价值,为通往下一代交互式学习环境的可扩展路径。

关键词

引用

@article{arxiv.2512.20858,
  title  = {ALIVE: An Avatar-Lecture Interactive Video Engine with Content-Aware Retrieval for Real-Time Interaction},
  author = {Md Zabirul Islam and Md Motaleb Hossen Manik and Ge Wang},
  journal= {arXiv preprint arXiv:2512.20858},
  year   = {2025}
}