中文

SemImage:用于文本的语义图像表示,一种嵌入解耦语言特征的新型框架

计算机视觉与模式识别 2025-12-02 v1 机器学习

摘要

我们提出 SemImage,一种将文本文档表示为二维语义图像以供卷积神经网络(CNN)处理的新方法。在 SemImage 中,每个词被表示为图像中的一个像素:行对应句子,并在句子之间插入额外的边界行以标记语义转换。每个像素并非典型的 RGB 值,而是解耦 HSV 色彩空间中的向量,编码不同的语言特征:色相由两个分量 H_cos 和 H_sin 组成,以考虑循环性,编码主题;饱和度编码情感;值编码强度或确定性。我们通过多任务学习框架实现这种解耦:ColorMapper 网络将每个词嵌入映射到 HSV 空间,并对 Hue 和 Saturation 通道应用辅助监督,以预测主题和情感标签,同时包含主任务目标。将动态计算的边界行插入句子之间可在连续句子语义不一致时生成锐利的视觉边界,有效使段落边界凸显。我们将 SemImage 与标准 2D CNN(如 ResNet)集成,用于文档分类。实验在多标签数据集(具有主题和情感标注)和单标签基准上均表明,SemImage 能在保持解释性的同时,实现优于强大的文本分类基线(包括 BERT 和层次注意力网络)的竞争或更好的准确率。消融研究确认多通道 HSV 表示和动态边界行的重要性。最后,我们呈现的 SemImage 可视化定性地揭示了生成图像中与主题变化和情感变化清晰对应的模式,表明我们的表示使这些语言特征对人类和机器都可见。

关键词

引用

@article{arxiv.2512.00088,
  title  = {SemImage: Semantic Image Representation for Text, a Novel Framework for Embedding Disentangled Linguistic Features},
  author = {Mohammad Zare},
  journal= {arXiv preprint arXiv:2512.00088},
  year   = {2025}
}