中文

大模型时代的特征编码:数据集、测试条件与基准

多媒体 2025-09-03 v4

摘要

大模型已在各种任务上取得了显著性能,但在训练和推理过程中均产生显著的计算成本和隐私问题。分布式部署已成为潜在解决方案,但它需要在模型各段之间交换中间信息,其中特征表示作为关键信息载体。为优化信息交换,需要特征编码来减少传输和存储开销。尽管其重要性,大模型的特征编码仍是一个未被充分探索的领域。本文将注意力引向大模型特征编码,并做出三项基础贡献。首先,我们引入了一个涵盖三种代表性大模型生成的多样化特征的综合性数据集。其次,我们建立了统一的测试条件,使未来特征编码研究能够实现标准化评估流程和公平比较。第三,我们从广泛使用的图像编码技术中推导出两种基线方法,并在所提出的数据集上基准测试其性能。这些贡献旨在为未来研究奠定基础,并激发该领域的更广泛参与。为支持长期研究,所有源代码和数据集均可在 https://github.com/chansongoal/LaMoFC 获取。

关键词

引用

@article{arxiv.2412.04307,
  title  = {Feature Coding in the Era of Large Models: Dataset, Test Conditions, and Benchmark},
  author = {Changsheng Gao and Yifan Ma and Qiaoxi Chen and Yenan Xu and Dong Liu and Weisi Lin},
  journal= {arXiv preprint arXiv:2412.04307},
  year   = {2025}
}