摘要:
医疗领域术语具有强异构性, 且标注数据稀缺, 导致语义特征表达较弱, 进而使检索精度较低, 为此,提出了半监督学习下医疗术语信息关键词模糊检索算法。利用词向量对原始医疗术语信息进行标准化处理与映射, 基于核心元数据信息节点和用户查询信息节点, 确定检索样本之间的置信度距离, 结合向量空间模型构建医疗术语信息元数据特征空间。在元数据特征空间内, 依据元数据的时间属性, 对各类数据进行合并处理,以此同步数据索引, 并结合多级索引集群与上下文编码增强语义特征。引入基于一致性正则化与熵最小化原则的 MixMatch 半监督学习算法, 利用少量标注数据对无标签数据进行数据增强, 从而生成无标签数据的低熵伪标签, 增强语义特征表达, 并计算检索词与候选信息的相似度, 实现跨类别或近义术语的高效匹配。实验结果表明, 应用设计的方法进行医疗术语信息关键词检索, 输出的检索结果与输入关键词适配度高于 95% ,可以提高信息检索的精度。
中图分类号:
朱越石, 郭凌辉.
半监督学习下医疗术语信息关键词模糊检索算法
[J]. 吉林大学学报(信息科学版), 2026, 44(4): 889-895.
ZHU Yueshi, GUO Linghui.
Semi-Supervised Learning-Based Fuzzy Retrieval Algorithm for Medical Term Information Keywords
[J]. Journal of Jilin University (Information Science Edition), 2026, 44(4): 889-895.