CommonVoice-SpeechRE 与 RPG-MoGe:通过新数据集和多阶生成框架推进语音关系抽取
计算与语言
2025-11-25 v2 多媒体
声音
音频与语音处理
摘要
语音关系抽取(SpeechRE)旨在从语音中直接抽取关系三元组。然而,现有基准数据集依赖合成数据,缺乏足够数量和多样性的真实人类语音。此外,现有模型也受制于僵化的单阶生成模板和弱语义对齐,显著限制了其性能。为应对这些挑战,我们引入了 CommonVoice-SpeechRE,一个由近 2 万个来自不同说话者的真实语音样本组成的大规模数据集,为 SpeechRE 研究建立了新的基准。此外,我们提出了关系提示引导的多阶生成集合(Relation Prompt-Guided Multi-Order Generative Ensemble, RPG-MoGe),这是一种新型框架,特点包括:(1)多阶三元组生成集合策略,利用训练和推理期间元素不同顺序的数据多样性;(2)基于 CNN 的潜在关系预测头生成显式关系提示,以指导跨模态对齐和准确的三元组生成。实验表明,我们的方法优于最先进的方法,为真实世界的 SpeechRE 提供了基准数据集和有效解决方案。源代码和数据集已公开于 https://github.com/NingJinzhong/SpeechRE_RPG_MoGe。
引用
@article{arxiv.2509.08438,
title = {CommonVoice-SpeechRE and RPG-MoGe: Advancing Speech Relation Extraction with a New Dataset and Multi-Order Generative Framework},
author = {Jinzhong Ning and Paerhati Tulajiang and Yingying Le and Yijia Zhang and Yuanyuan Sun and Hongfei Lin and Haifeng Liu},
journal= {arXiv preprint arXiv:2509.08438},
year = {2025}
}