多模态模型的比例定律假设
机器学习
2024-11-12 v4 人工智能
摘要
我们提出了一种用于处理文本、音频、图像和视频的多模态模型比例定律假设,这些模型在共享的标记和嵌入空间中进行处理。我们的框架根据模态特定的压缩和标记化效率预测模型性能,扩展了从文本基Decoder模型的 established scaling laws 到混合模态系统。我们探讨了是否可以通过利用多个模态的更多训练数据来减小多模态模型的规模,从而实现在资源受限设备上的高效部署。
引用
@article{arxiv.2409.06754,
title = {Scaling Law Hypothesis for Multimodal Model},
author = {Qingyun Sun and Zhen Guo and PIN AI Team},
journal= {arXiv preprint arXiv:2409.06754},
year = {2024}
}