中文

面向实时说话人像合成的音频特征提取比较分析

声音 2024-11-21 v1 人工智能 人机交互 音频与语音处理

摘要

本文探讨了将实时说话人像生成技术整合以用于面试官培训,重点关注克服音频特征提取(AFE)中的挑战,该环节常在实时应用中引入延迟并限制响应速度。为解决这些问题,我们提出并实现了一个完全集成的系统,使用 Open AI 的 Whisper 替代传统 AFE 模型,利用其编码器优化处理过程并提升系统整体效率。我们在三个不同数据集上对两个开源实时模型进行了评估,结果表明 Whisper 不仅加快了处理速度,还改善了渲染质量的特定方面,从而实现了更逼真、响应更快的说话人像交互。这些进展使该系统成为沉浸式交互培训应用更有效的工具,拓展了 AI 驱动的虚拟形象在面试官培训中的潜力。

关键词

引用

@article{arxiv.2411.13209,
  title  = {Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis},
  author = {Pegah Salehi and Sajad Amouei Sheshkal and Vajira Thambawita and Sushant Gautam and Saeed S. Sabet and Dag Johansen and Michael A. Riegler and Pål Halvorsen},
  journal= {arXiv preprint arXiv:2411.13209},
  year   = {2024}
}

备注

16 pages, 6 figures, 3 tables. submitted to MDPI journal in as Big Data and Cognitive Computing