基于Spark引擎和FNLP的微博用户行为大数据分析系统介绍

基于Spark引擎和FNLP的微博用户行为大数据分析系统介绍

2026年3月12日·
廖傲然
· 2 分钟阅读时长
集群控制台
blog

本系统是在充分研究大数据关键技术和微博数据分析现状的基础上设计的微博数据分析系统,包括利用分布式爬虫框架和FLUME实现数据采集模块,编写SPARK应用程序实现数据分析模块,通过HDFS和HBase完成数据存储模块,基于SPRINGBOOT框架构建数据可视化模块。最终整个系统在满足大数据处理需求的同时,能够完成微博数据的多种分析任务。

主要的分析任务包括用户影响力分析、微博话题挖掘和用户情感分析。以下对各个任务做简要介绍:

  • 影响力分析,本系统从粉丝对用户影响力的贡献角度考虑,基于pagerank算法对用户的关注列表进行分析,评估其影响力,最终获得影响力top10的用户,点击该用户下钻后,根据采集到的地区信息在地图上标识出该用户在不同地区的影响力;并通过饼图展示该用户的粉丝分类。
  • 微博话题挖掘,微博话题挖掘可以看做是一个聚类过程。这里选择LDA算法对微博文本进行聚类,从而提炼出其中的隐藏话题。最后将筛选后有意义的结果以词云的形式展示出来,每一朵云则表示一类话题。

用户情感分析在分析时将情感词分为正向、负向和中立三种倾向。首先从意群出发,依据微博情感词典找出情感词汇并确定其极性,然后前情感词为基准,向前定位该情感词的修饰词,并用修饰词对应的权值进行加权处理,得到意群的情感得分;将分句内所有的意群得分统计相加,考虑句尾标点符号的影响,将意群得分之和再根据句尾标点进行加权,得到整个分句的情感得分。最后,将微博文本中所有分句的得分汇总获得微博的情感倾向。