电话中的生成语音冲击
声音
2025-06-10 v1 神经与进化计算
音频与语音处理
摘要
在紧急情况下,传统移动电话无法向已占线的接收方传递紧急语音消息。标准的呼叫等待提示无法提供紧急性或消息内容。本文提出了一种 novel 方法,用于在 ongoing calls 期间传输生成语音冲击(Generative Voice Bursts)——短小、上下文感知的音频消息,来自预授权或动态优先级更高的呼叫方。通过利用生成式 AI 技术,该系统会自动从上下文输入(例如位置、健康数据、图像、背景噪声)生成 spoken messages,因为呼叫方因 incapacitation 或环境限制而无法发声。该解决方案集成了语音、文本和优先级推断机制,允许高优先级紧急消息绕过常规呼叫等待障碍。该方法采用 GPT Neo 等模型进行生成式文本,随后合成为音频并以可配置的 G 秒间隔和 N 次次数传递,确保最小干扰且保留紧急性。该方法在电信、移动设备制造和紧急通信平台方面具有显著的潜在影响。
引用
@article{arxiv.2506.07526,
title = {Generative Voice Bursts during Phone Call},
author = {Paritosh Ranjan and Surajit Majumder and Prodip Roy},
journal= {arXiv preprint arXiv:2506.07526},
year = {2025}
}
备注
12 pages, 2 figures