中文

30 余年自动歌唱评估与歌唱信息处理综述

音频与语音处理 2026-01-21 v1 声音

摘要

自动歌唱评估与歌唱信息处理在过去三十年中不断发展,以支持歌唱教学、表演分析和声乐训练。前者通过从实时视觉反馈和声学生物反馈到复杂的音高跟踪和频谱分析等计算指标客观地评估歌手的表现,而后者则将预测的声乐信号与目标参考进行比较,以捕获嵌入在歌声中的细微数据。显著的进步包括开发了显著改善实时视觉反馈的交互式系统,以及整合了机器学习和深度神经网络架构以增强声乐信号处理的精度。本综述批判性地审视了文献,以描绘这些技术的历史演变,同时识别并讨论了关键差距。分析揭示了持续的挑战,例如缺乏标准化的评估框架、难以可靠地将声乐信号与各种噪声源分离,以及先进数字信号处理和人工智能方法在捕捉艺术表现力方面的利用不足。通过详细阐述这些局限性和相应的技术进步,本综述展示了解决这些问题如何能够弥合客观计算评估与主观类人歌唱表演评价之间的差距,最终提升自动歌唱评估系统的技术准确性和教学相关性。

关键词

引用

@article{arxiv.2601.12153,
  title  = {A Survey on 30+ Years of Automatic Singing Assessment and Singing Information Processing},
  author = {Arthur N. dos Santos and Bruno S. Masiero},
  journal= {arXiv preprint arXiv:2601.12153},
  year   = {2026}
}