中文

面向大规模视频特征索引的网络内张量融合——ViFusion

多媒体 2025-06-23 v1

摘要

大规模视频特征索引在数据中心至关依赖于高效的数据传输。虽然网络内计算(in-network computation)已成为加速特征提取并减少分布式多媒体系统开销的引人注目的策略,但在交换机和主机水平上发挥高级网络资源仍然具有巨大挑战。这些困难又因异构硬件、多样化的应用需求以及复杂的多路径拓扑结构而加剧。现有方法主要关注使用专用集合通信库优化大型神经网络模型的推理,这些方法常在网络拥塞场景下面临性能下降。为克服这些限制,我们提出了 ViFusion,一种 communication-aware 张量融合框架,通过将众多小特征张量合并为统一且更易管理的单元,来简化分布式视频索引的工作流程。通过在数据中心环境中集成网络内计算模块和专用张量融合机制,ViFusion 大幅提高了视频特征索引工作流程的效率。部署结果表明,ViFusion 在与最先进系统相同延迟水平下,将视频检索系统的吞吐量提高了 8–22 倍。

关键词

引用

@article{arxiv.2506.16258,
  title  = {ViFusion: In-Network Tensor Fusion for Scalable Video Feature Indexing},
  author = {Yisu Wang and Yixiang Zhu and Xinjiao Li and Yulong Zhang and Ruilong Wu and Dirk Kutscher},
  journal= {arXiv preprint arXiv:2506.16258},
  year   = {2025}
}