野生语音中采集副音:一种内容受控、隐私优先的智能手机协议与实证评估
人机交互
2026-03-19 v1 音频与语音处理
摘要
收集语音数据进行副音分析具有诸多挑战,包括副音与语义的混合、隐私限制以及参与者的合规性。我们提出一种内容受控、隐私优先的智能手机协议,使用脚本化朗读句子标准化词汇内容(包括提示情感价值),同时捕获自然的副音变异。该协议在设备上执行副音特征提取,立即删除原始音频,只传输派生特征用于分析。我们在大型研究中部署了该协议(N=560;9877次录音),评估了合规性和数据质量,并对提取的特征进行了诊断性预测任务,预测说话人性别及同时报告的情绪状态(情感价值、唤醒度)。我们讨论了该协议的意义及未来发展方向。
引用
@article{arxiv.2603.17061,
title = {Collecting Prosody in the Wild: A Content-Controlled, Privacy-First Smartphone Protocol and Empirical Evaluation},
author = {Timo K. Koch and Florian Bemmann and Ramona Schoedel and Markus Buehner and Clemens Stachl},
journal= {arXiv preprint arXiv:2603.17061},
year = {2026}
}
备注
Submitted to Interspeech 2026