AutoVisual Fusion Suite:HuggingFace平台上图像分割与语音转换工具的综合评估
计算机视觉与模式识别
2024-01-15 v2
摘要
本研究对HuggingFace平台上用于人工智能两个关键应用(图像分割和语音转换)的工具进行了综合评估。主要目标是识别每个类别中的前三名工具,随后在Linux系统上安装和配置这些工具。我们利用了预训练分割模型(如SAM和基于ResNet-50骨干网络的DETR模型)进行图像分割,以及so-vits-svc-fork模型进行语音转换。本文深入探讨了实施过程中遇到的方法和挑战,并展示了在一个名为AutoVisual Fusion Suite的统一项目中成功结合视频分割和语音转换的成果。
引用
@article{arxiv.2401.05379,
title = {AutoVisual Fusion Suite: A Comprehensive Evaluation of Image Segmentation and Voice Conversion Tools on HuggingFace Platform},
author = {Amirreza Hashemi},
journal= {arXiv preprint arXiv:2401.05379},
year = {2024}
}
备注
27 pages, 21 figures