打破文本依赖与音频匮乏 AI 的壁垒
声音
2025-06-04 v1 音频与语音处理
摘要
尽管全球语言多样性涵盖超过 7164 种已知语言,但当前占主导地位的机器智能架构在根本上仍偏向于书面文本。这种偏见排除了超过 7 亿人,尤其是农村和偏远地区具备音频素养的人群。在本工作中,我们引入了一个完全无文本的音频到音频机器智能框架,旨在服务这一未被充分覆盖的人群以及所有偏好音频效率的人。我们的贡献包括完全绕过文本的新型音频到音频翻译架构,涵盖基于频谱图、标度图、小波和单元的模型。我们方法的核心是多尺度音频语义变换(MAST),这是一种对音调、韵律、说话人和表达特征进行编码的表示。我们进一步将 MAST 整合到由分数布朗运动驱动的均场型分数扩散框架中。它能够在不依赖文本监督的情况下生成高保真、语义一致的语音。其结果是一个稳健且可扩展的系统,能够直接从原始音频中学习,即使是针对未书写或极少数字化的语言。这项工作代表了向音频原生机器智能系统的根本性转变,为历史上被排除在当前机器智能生态系统之外的社区扩展了语言技术的可及性。
引用
@article{arxiv.2506.02443,
title = {Breaking the Barriers of Text-Hungry and Audio-Deficient AI},
author = {Hamidou Tembine and Issa Bamia and Massa NDong and Bakary Coulibaly and Oumar Issiaka Traore and Moussa Traore and Moussa Sanogo and Mamadou Eric Sangare and Salif Kante and Daryl Noupa Yongueng and Hafiz Tiomoko Ali and Malik Tiomoko and Frejus Laleye and Boualem Djehiche and Wesmanegda Elisee Dipama and Idris Baba Saje and Hammid Mohammed Ibrahim and Moumini Sanogo and Marie Coursel Nininahazwe and Abdul-Latif Siita and Haine Mhlongo and Teddy Nelvy Dieu Merci Kouka and Mariam Serine Jeridi and Mutiyamuogo Parfait Mupenge and Lekoueiry Dehah and Abdoul Aziz Bio Sidi Bouko and Wilfried Franceslas Zokoue and Odette Richette Sambila and Alina RS Mbango and Mady Diagouraga and Oumarou Moussa Sanoussi and Gizachew Dessalegn and Mohamed Lamine Samoura and Bintou Laetitia Audrey Coulibaly},
journal= {arXiv preprint arXiv:2506.02443},
year = {2025}
}
备注
61 pages, 16 figures, 14 tables, 25 languages, 13 blockaudio per language. Presented at AI Mali, May 2025