GPT-4o语音模式的初步探索
计算与语言
2025-02-17 v1 声音
音频与语音处理
摘要
随着多模态大语言模型的兴起,GPT-4o作为一种开创性模型,推动我们评估其能力。本报告评估了GPT-4o在各种任务中的表现,以分析其音频处理和推理能力。我们发现GPT-4o在音频、语音和音乐理解方面表现出强大的知识,能够在意图分类、 spoken command 分类、语义和语法推理、多语言语音识别和歌唱分析等任务中表现良好。它还比其他大型音频语言模型(LALMs)在抗幻觉方面表现更好。然而,它在音频时长预测和乐器分类等任务中表现不佳。此外,GPT-4o的安全机制会导致它拒绝执行说话人识别、年龄分类、MOS预测和音频深度伪造检测等任务。值得注意的是,模型在不同数据集上的说话人验证任务中的拒绝率显著不同。这可能是由于附加指令或输入音频质量的差异所致,表明其内置安全措施具有高度敏感性。最后,我们承认模型性能会因评估协议而异。本报告仅作为当前LALMs状态的初步探索。
引用
@article{arxiv.2502.09940,
title = {A Preliminary Exploration with GPT-4o Voice Mode},
author = {Yu-Xiang Lin and Chih-Kai Yang and Wei-Chih Chen and Chen-An Li and Chien-yu Huang and Xuanjun Chen and Hung-yi Lee},
journal= {arXiv preprint arXiv:2502.09940},
year = {2025}
}
备注
Work in progress