量化音频语言模型能否执行零样图防伪检测?
声音
2025-06-10 v1 音频与语音处理
摘要
量化是将大型音频语言模型 (LALM) 部署到资源受限环境中的关键技术,但其对零样图音频防伪检测等复杂任务的影响尚未得到充分探索。本研究评估了 GAMA、LTU-AS、MERaLiON、Qwen-Audio 和 SALMONN 五种 LALMs 在 ASVspoof2019、In-the-Wild 和 WaveFake 三个数据集上的零样图能力,并考察其对量化 (FP32、FP16、INT8) 的鲁棒性。尽管初始防伪检测准确率较高,但我们的分析显示所有模型在防伪分类上都存在严重的预测偏差,导致实际性能等同于随机分类。有趣的是,FP16 量化相对于 FP32 几乎没有性能下降,有效地在减半内存和计算需求的同时保持准确率。然而,INT8 量化加剧了模型偏差,显著降低了平衡准确率。这些发现揭示了关键架构局限性,强调 FP16 量化是最佳权衡,为实际部署和未来模型改进提供了指导。
引用
@article{arxiv.2506.06756,
title = {Can Quantized Audio Language Models Perform Zero-Shot Spoofing Detection?},
author = {Bikash Dutta and Rishabh Ranjan and Shyam Sathvik and Mayank Vatsa and Richa Singh},
journal= {arXiv preprint arXiv:2506.06756},
year = {2025}
}
备注
Accepted in Interspeech 2025