4667.
针对CLIP在弱监督语义分割任务中存在的细粒度建模不足与空间敏感性缺失问题, 本文提出了一种基于全局-局部嵌入动态融合的弱监督语义分割模型GLE-CLIP. 该模型通过双向交叉注意力模块(BCA)构建文本语义与图像局部特征的交互关系, 生成鉴别性更强的局部嵌入; 同时设计动态注意力融合机制(DAF), 以相似度驱动的权重分配策略自适应平衡全局语义与局部细节. 具体而言, 首先通过定位解码器提取多尺度像素级嵌入, 利用文本到像素以及像素到文本的双向交叉注意力来增强模态对齐, 并结合全局嵌入的动态投影实现跨粒度特征融合. 在PASCAL VOC 2012和MS COCO数据集上的实验表明, 通过本方法训练的分割模型的性能超越现有大部分语言监督方法,
mIoU分别达75.%与47.9%. 消融实验证实了交叉注意力模块与动态融合机制的有效性, 可视化结果进一步揭示了方法对高频细节的捕捉能力.… …
相似文献