基于人类意图分析和大语言模型的音乐发现对话生成
声音
2024-11-13 v1 信息检索
音频与语音处理
摘要
对话式音乐检索系统可以帮助用户通过对话发现符合其偏好的音乐。为实现这一点,对话式音乐检索系统应通过1)理解用户查询和2)用自然语言和检索到的音乐回复,无缝地参与多轮对话。一个直接的解决方案是利用此类对话日志的数据驱动方法。然而,可用于研究的数据集很少,且在数量和质量上受限。本文提出了一个利用大语言模型(LLM)、用户意图、系统动作和音乐属性生成丰富音乐发现对话的数据生成框架。这是通过i)基于扎根理论的对话意图分析,ii)通过级联数据库过滤生成属性序列,iii)使用大语言模型生成话语来完成的。将该框架应用于Million Song数据集,我们创建了LP-MusicDialog,一个基于大语言模型的伪音乐对话数据集,包含使用超过319k音乐条目的288k多音乐对话。我们的评估表明,该合成数据集在对话一致性、条目相关性和自然性方面与现有的小型人类对话数据集具有竞争力。此外,利用该数据集,我们训练了一个对话式音乐检索模型并展示了有希望的结果。
引用
@article{arxiv.2411.07439,
title = {Music Discovery Dialogue Generation Using Human Intent Analysis and Large Language Models},
author = {SeungHeon Doh and Keunwoo Choi and Daeyong Kwon and Taesu Kim and Juhan Nam},
journal= {arXiv preprint arXiv:2411.07439},
year = {2024}
}
备注
Accepted for publication at the 25th International Society for Music Information Retrieval Conference (ISMIR 2024)