中文

PaperWave:将研究论文作为由 LLM 编写的对话式播客来收听

人机交互 2025-01-23 v2

摘要

收听音频内容,例如播客和有声读物,是人们接触知识的一种方式。与通过阅读来看相比,收听赋予了人们更多的移动性,从而拓宽了他们的学习机会。本研究探讨了大型语言模型 (LLM) 在将文本文档改编为音频内容方面的潜在应用,并解决了诸如研究论文等小众内容缺乏适合收听的材料的问题。LLM 可以生成各种风格的音频内容脚本,以满足特定需求,例如完整内容时长或语音类型(独白或对话)。为了探索这种潜力,我们开发了 PaperWave 作为原型,将学术论文 PDF 转换为对话式播客。我们为期两个月的调查涉及 11 名参与者(包括作者),采用了自传式设计、实地研究和设计研讨会。研究结果强调了在设计文档到音频系统时考虑听众与其环境交互的重要性。

关键词

引用

@article{arxiv.2410.15023,
  title  = {PaperWave: Listening to Research Papers as Conversational Podcasts Scripted by LLM},
  author = {Yuchi Yahagi and Rintaro Chujo and Yuga Harada and Changyo Han and Kohei Sugiyama and Takeshi Naemura},
  journal= {arXiv preprint arXiv:2410.15023},
  year   = {2025}
}