VERSA:面向语音、音频与音乐的通用评估工具包
声音
2025-03-28 v2 多媒体
音频与语音处理
摘要
本文介绍了 VERSA,一款用于 various 语音、音频和音乐信号的统一且标准化的评估工具包。该工具包提供 Pythonic 接口,支持灵活的配置和依赖控制,具有用户友好和高效的特点。在完整安装后,VERSA 提供 65 项指标,基于不同配置共计 729 种指标变体。这些指标涵盖了利用多样化外部资源的评估,包括匹配与非匹配参考音频、文本转录及文本标题。作为一个轻量且全面的工具包,VERSA 能够支持广泛的下游场景评估。为展示其功能本文列举了 VERSA 的示例用例,包括音频编码、语音合成、语音增强、歌声合成以及音乐生成。该工具包已发布于 https://github.com/wavlab-speech/versa。
引用
@article{arxiv.2412.17667,
title = {VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music},
author = {Jiatong Shi and Hye-jin Shim and Jinchuan Tian and Siddhant Arora and Haibin Wu and Darius Petermann and Jia Qi Yip and You Zhang and Yuxun Tang and Wangyou Zhang and Dareen Safar Alharthi and Yichen Huang and Koichi Saito and Jionghao Han and Yiwen Zhao and Chris Donahue and Shinji Watanabe},
journal= {arXiv preprint arXiv:2412.17667},
year = {2025}
}