基于 GRPO 微调和校准分段级预测的音频问答
声音
2025-11-19 v1 机器学习
摘要
本报告描述了我们对 DCASE 2025 挑战第 5 轨道任务——音频问答(AQA)的提交方案。我们的系统利用 SSL 基础模型 BEATs 提取帧级音频特征,然后通过分类头生成基于 Audioset 本体法的声学事件分段预测。随后对这些分段预测进行校准,以生成事件级预测。最后将这些预测与问题和候选答案一起纳入结构化提示输入到使用 GRPO 算法微调的 Qwen2.5-7B-Instruct。我们的方法在开发集上实现了 62.6% 的准确率,展示了将声学事件推理与指令微调的大型语言模型相结合用于 AQA 的有效性。
引用
@article{arxiv.2511.14307,
title = {Audio Question Answering with GRPO-Based Fine-Tuning and Calibrated Segment-Level Predictions},
author = {Marcel Gibier and Nolwenn Celton and Raphaël Duroselle and Pierre Serrano and Olivier Boeffard and Jean-François Bonastre},
journal= {arXiv preprint arXiv:2511.14307},
year = {2025}
}
备注
Submission to Track 5 of the DCASE 2025 Challenge