中文

AutoVisual Fusion Suite:HuggingFace平台上图像分割与语音转换工具的综合评估

计算机视觉与模式识别 2024-01-15 v2

摘要

本研究对HuggingFace平台上用于人工智能两个关键应用(图像分割和语音转换)的工具进行了综合评估。主要目标是识别每个类别中的前三名工具,随后在Linux系统上安装和配置这些工具。我们利用了预训练分割模型(如SAM和基于ResNet-50骨干网络的DETR模型)进行图像分割,以及so-vits-svc-fork模型进行语音转换。本文深入探讨了实施过程中遇到的方法和挑战,并展示了在一个名为AutoVisual Fusion Suite的统一项目中成功结合视频分割和语音转换的成果。

关键词

引用

@article{arxiv.2401.05379,
  title  = {AutoVisual Fusion Suite: A Comprehensive Evaluation of Image Segmentation and Voice Conversion Tools on HuggingFace Platform},
  author = {Amirreza Hashemi},
  journal= {arXiv preprint arXiv:2401.05379},
  year   = {2024}
}

备注

27 pages, 21 figures