中文

利用大语言模型进行自动化视频内容分析:关于抑郁短视频的探索性工作流程

人机交互 2024-07-31 v3 人工智能 计算机与社会

摘要

尽管对利用大语言模型进行内容分析的兴趣日益增长,但当前研究主要聚焦于文本内容。本文探索了大语言模型在辅助视频内容分析中的潜力,通过开展案例研究来实施一种新的大语言模型辅助多模态内容分析工作流程。该工作流程包括:制定编码表、提示工程、大语言模型处理以及人工评估。我们战略性地设计了标注提示,以获取结构化形式的大语言模型标注,以及解释性提示,以生成大语言模型解释,以更好地理解大语言模型的推理过程和透明性。为测试大语言模型的视频标注能力,我们分析了来自25个关于抑郁的YouTube短视频中提取的203个关键帧。我们将大语言模型标注与两位人类编码员的标注进行比较,发现大语言模型在物体和活动标注方面的准确率高于情感和类型标注。此外,我们确定了大语言模型在标注视频方面的潜力与局限性。基于这些发现,我们探讨了未来研究和工作流程改进的机会与挑战。我们还讨论了基于大语言模型辅助视频分析的未来研究所涉及的伦理问题。

关键词

引用

@article{arxiv.2406.19528,
  title  = {Harnessing LLMs for Automated Video Content Analysis: An Exploratory Workflow of Short Videos on Depression},
  author = {Jiaying Lizzy Liu and Yunlong Wang and Yao Lyu and Yiheng Su and Shuo Niu and Xuhai Orson Xu and Yan Zhang},
  journal= {arXiv preprint arXiv:2406.19528},
  year   = {2024}
}

备注

7 pages, 2 figures, accepted by CSCW 24