中文

超越准确率:度量嵌入的表示容量以保留结构与上下文信息

机器学习 2023-09-21 v1

摘要

有效的数据表示在各种机器学习任务中至关重要,因为它捕捉了数据的底层结构与上下文。嵌入已成为一种强大的数据表示技术,但评估其质量以及保留结构与上下文信息的能力仍是一项挑战。在本文中,我们通过提出一种度量嵌入的\textit{表示容量}(representation capacity)的方法来应对这一需求。这项工作的动机源于理解嵌入的优势与局限的重要性,使研究人员与从业者能够在为其特定应用选择合适的嵌入模型时做出明智决策。通过结合外在评价方法(如分类与聚类)以及基于 t-SNE 的邻域分析(如邻域一致性与可信度),我们提供了对表示容量的全面评估。此外,使用优化技术(贝叶斯优化)进行权重优化(针对分类、聚类、邻域一致性与可信度)确保了在选择最优指标组合时采用客观且数据驱动的方法。所提出的方法不仅有助于推进嵌入评估领域的发展,还为研究人员与从业者提供了一种定量度量手段,以评估嵌入在捕捉结构与上下文信息方面的有效性。在评估中,我们使用了 33 个真实世界的生物序列(蛋白质与核苷酸)数据集,并对文献中的 44 种嵌入方法(即 Spike2Vec、Spaced kk-mers、PWM2Vec 和 AutoEncoder)进行了表示容量分析。

关键词

引用

@article{arxiv.2309.11294,
  title  = {Beyond Accuracy: Measuring Representation Capacity of Embeddings to Preserve Structural and Contextual Information},
  author = {Sarwan Ali},
  journal= {arXiv preprint arXiv:2309.11294},
  year   = {2023}
}

备注

Accepted at ISBRA 2023