一、安装Spark
- 检查基础环境hadoop,jdk
- 配置文件
- 环境变量
- 试运行Python代码
二、Python编程练习:英文文本的词频统计
- 准备文本文件
- 读文件
- 预处理:大小写,标点符号,停用词
- 分词
- 统计每个单词出现的次数
- 按词频大小排序
- 结果写文件
来源:https://www.cnblogs.com/dhqcom/p/15974306.html
本站部分图文来源于网络,如有侵权请联系删除。
一、安装Spark
二、Python编程练习:英文文本的词频统计
来源:https://www.cnblogs.com/dhqcom/p/15974306.html
本站部分图文来源于网络,如有侵权请联系删除。