基于 MIL 和 RL 的跨语言说话人属性预测
人工智能
2026-01-09 v1
摘要
我们研究了在语言变异、领域不匹配和语言间数据不平衡的情况下的多语言说话人属性预测。我们提出 RLMIL-DAT,这是一个多语言强化多个实例学习框架的扩展,通过结合基于强化学习的实例选择与域对抗训练,鼓励语言不变的说话人表征。我们在五语 Twitter 语料库(以 few shot 方式)和覆盖四十种语言的 VoxCeleb2 派生语料库(以 zero shot 方式)上进行评估,用于性别和年龄预测。在广泛的模型配置和多个随机种子下,RLMIL-DAT 在 Macro F1 上 consistently 优于标准多个实例学习和原始强化多个实例学习框架。最大收益出现在性别预测上,而年龄预测仍较具挑战性,表现出较小但正面的改进。消融实验表明,域对抗训练是性能提升的主要贡献者,通过抑制共享编码器中的语言特定线索,实现了从高资源英语到低资源语言的有效迁移。在较小的 VoxCeleb2 子集上进行 zero shot 实验中,改进大体为正,但不够一致,这反映了统计功效有限以及对众多未见语言的泛化难度。总体而言,结果表明,结合实例选择与对抗域适应是跨语言说话人属性预测的有效且稳健的策略。
引用
@article{arxiv.2601.04257,
title = {Cross-Language Speaker Attribute Prediction Using MIL and RL},
author = {Sunny Shu and Seyed Sahand Mohammadi Ziabari and Ali Mohammed Mansoor Alsahag},
journal= {arXiv preprint arXiv:2601.04257},
year = {2026}
}