中文

Txt2Vid:基于文本的超低位率说话人头视频压缩

图像与视频处理 2022-04-05 v3 多媒体

摘要

如今视频占据了互联网流量的大部分,在更高质量内容生成、更大文件传输与网络基础设施发展之间持续上演着竞赛。此外,近期的新冠疫情推动了视频会议工具使用的激增。由于视频占用可观的带宽(约 100 Kbps 至几 Mbps),改进视频压缩可对直播与录播内容的网络性能产生实质影响,从而在全球范围内提供更广泛的多媒体内容访问。我们提出了一种新颖的视频压缩流水线,称为 Txt2Vid,它通过将网络摄像头视频(“说话人头视频”)压缩为文本转录本,大幅降低数据传输速率。该文本被传输,并利用近期基于深度学习的语音克隆与唇形同步模型解码为原始视频的真实重建。我们的生成式流水线相比标准音视频编解码器(编码器-解码器)实现了比特率降低两到三个数量级,同时在基于用户(n = 242)在线研究中主观评价的体验质量上保持等同。Txt2Vid 框架为创建如弱网互联或有限带宽偏远地形中的音视频通信等新型应用开辟了潜力。本工作的代码可在 https://github.com/tpulkit/txt2vid.git 获取。

关键词

引用

@article{arxiv.2106.14014,
  title  = {Txt2Vid: Ultra-Low Bitrate Compression of Talking-Head Videos via Text},
  author = {Pulkit Tandon and Shubham Chandak and Pat Pataranutaporn and Yimeng Liu and Anesu M. Mapuranga and Pattie Maes and Tsachy Weissman and Misha Sra},
  journal= {arXiv preprint arXiv:2106.14014},
  year   = {2022}
}

备注

11 pages, 8 figures, 2 table. Addition of statistical analysis of results. Reorganization and rewriting of text to make it clearer