节点文献

知识-视觉深度协同的KB-VQA应用研究

  • 推荐 CAJ下载
  • PDF下载
  • 不支持迅雷等下载工具,请取消加速工具后下载。

【作者】 赵俊东余艳梅陶青川

【Author】 ZHAO Jundong;YU Yanmei;TAO Qingchuan;

【通讯作者】 余艳梅;

【机构】 四川大学电子信息学院

【摘要】 知识的视觉问答(KB-VQA)任务旨在借助外部知识对复杂视觉问题进行解答,然而现有方法仍面临诸多挑战,如对文本检索知识的过度依赖易导致检索偏差、对图像视觉细节的捕捉能力不足,且预训练模型的深层推理能力未得到充分挖掘。针对上述问题,文章提出一种新型知识-图像融合与视觉特征集成模型(KIVI)。该模型依托多模态预训练模型实现图文信息的深度融合,以此提升外部知识的检索精度;同时结合图像内容与检索知识,生成聚焦图像关联信息的视觉多模态知识。此外,KIVI模型整合图像的区域局部特征与全局整体特征,保障视觉信息的完整提取;并设计融合候选答案与推理路径的提示策略,有效激活预训练模型的深层推理能力。实验结果表明,KIVI模型在OK-VQA数据集上的准确率为67.29%,性能优于目前所有最优方法。

  • 【文献出处】 信息技术与信息化 ,Information Technology and Informatization , 编辑部邮箱 ,2026年02期
  • 【分类号】TP391.41;TP18
  • 【下载频次】22
节点文献中: 

本文链接的文献网络图示:

本文的引文网络