中文

基于 GRPO 微调和校准分段级预测的音频问答

声音 2025-11-19 v1 机器学习

摘要

本报告描述了我们对 DCASE 2025 挑战第 5 轨道任务——音频问答(AQA)的提交方案。我们的系统利用 SSL 基础模型 BEATs 提取帧级音频特征,然后通过分类头生成基于 Audioset 本体法的声学事件分段预测。随后对这些分段预测进行校准,以生成事件级预测。最后将这些预测与问题和候选答案一起纳入结构化提示输入到使用 GRPO 算法微调的 Qwen2.5-7B-Instruct。我们的方法在开发集上实现了 62.6% 的准确率,展示了将声学事件推理与指令微调的大型语言模型相结合用于 AQA 的有效性。

关键词

引用

@article{arxiv.2511.14307,
  title  = {Audio Question Answering with GRPO-Based Fine-Tuning and Calibrated Segment-Level Predictions},
  author = {Marcel Gibier and Nolwenn Celton and Raphaël Duroselle and Pierre Serrano and Olivier Boeffard and Jean-François Bonastre},
  journal= {arXiv preprint arXiv:2511.14307},
  year   = {2025}
}

备注

Submission to Track 5 of the DCASE 2025 Challenge