摘要:
为有效挖掘和利用网页数据, 以爬虫技术为支持, 提出一种关联数据自适应挖掘算法。利用爬虫技术爬取电商网页, 突破数据获取限制, 将所需数据以结构化格式存储至数据库, 为后续处理提供有序数据基础。基于存储在数据库中的稀疏数据, 依据最小支持度并运用Apriori 算法, 并通过剪枝策略, 在减少数据处理量的同时, 能在稀疏数据中精准找出频繁项集, 成功解决传统方法因数据稀疏难以获取频繁项集的问题。以树形结构为框架, 将Apriori 算法得到的频繁项集作为结点, 通过自适应结合旧结点与新结点构建挖掘树, 直至无结点可结合, 使其生成的挖掘树全面呈现数据关联关系, 进而得到充分且精准的电商网页关联数据挖掘结果。经在大型电商网站的网页上验证后表明, 所提算法能确保网页爬取的完整性, 准确获得以购买行为为目标的频繁项集, 精准挖掘电商网页中的关联数据, 在为电商平台运营提供有益参考的同时, 给予商家和消费者更好的决策支持。
中图分类号:
王 琪.
基于爬虫技术的电商网页关联数据自适应挖掘算法
[J]. 吉林大学学报(信息科学版), 2026, 44(4): 991-997.
WANG Qi.
Adaptive Mining Algorithm for Association Data of E-commerce Web Page Based on Crawler Technology
[J]. Journal of Jilin University (Information Science Edition), 2026, 44(4): 991-997.