中文

基于语谱图的音乐录音中自动调音人声检测

声音 2024-03-11 v1 计算机视觉与模式识别 音频与语音处理

摘要

在音乐制作和音频处理领域,歌唱声音的自动音高校正(也称为 Auto-Tune)的实施显著改变了人声表演的格局。虽然自动调音技术使音乐家能够调整其人声音高并达到所需的精度水平,但其使用也引发了关于其对真实性和艺术完整性影响的争论。因此,检测和分析音乐录音中的 Auto-Tuned 人声对于音乐学者、制作人和听众而言变得至关重要。然而,据我们所知,此前尚未在此方向上进行过任何努力。本研究引入了一种利用三元组网络 (triplet networks) 检测 Auto-Tuned 歌曲的数据驱动方法,并构建了由原始音频片段和 Auto-Tuned 音频片段组成的数据集作为支持。实验结果表明,与 Rawnet2(一种为反欺骗提出并广泛用于其他音频取证任务的端到端模型)相比,所提出的方法在准确性和鲁棒性方面均表现出优越性。

关键词

引用

@article{arxiv.2403.05380,
  title  = {Spectrogram-Based Detection of Auto-Tuned Vocals in Music Recordings},
  author = {Mahyar Gohari and Paolo Bestagini and Sergio Benini and Nicola Adami},
  journal= {arXiv preprint arXiv:2403.05380},
  year   = {2024}
}