中文

QvTAD:基于微分注意力的相对属性学习用于声音时光属性检测

声音 2025-08-25 v1 音频与语音处理

摘要

声音时光属性检测(vTAD)在语音生成任务中发挥着关键作用于细粒度时光建模。然而,由于时光描述符的内在主观性以及现有数据集中严重的标签不平衡问题,vTAD 仍面临挑战。本文提出 QvTAD,一种基于微分注意力的新颖配对比较框架,用于增强感知时光属性的建模。为解决 VCTK-RVA 数据集中的标签不平衡问题,我们引入基于图的增强策略,通过构建有向无环图并运用不相交集合联合技术(Disjoint-Set Union)来自动挖掘具有有效属性比较关系的未观察语音对。我们的框架利用来自预训练 FACodec 的说话人嵌入,并包含相对时光位移感知微分注意力模块。该模块通过微分去噪和对比放大机制,显式建模配对语音之间的属性特定对比。在 VCTK-RVA 基准测试上的实验结果表明,QvTAD 在多个时光描述符上均实现了显著提升,尤其在跨说话人泛化场景中取得了显著的 gains。

关键词

引用

@article{arxiv.2508.15931,
  title  = {QvTAD: Differential Relative Attribute Learning for Voice Timbre Attribute Detection},
  author = {Zhiyu Wu and Jingyi Fang and Yufei Tang and Yuanzhong Zheng and Yaoxuan Wang and Haojun Fei},
  journal= {arXiv preprint arXiv:2508.15931},
  year   = {2025}
}

备注

Accepted by National Conference on Man-Machine Speech Communication, NCMMSC'2025