导航:首页 > 文档加密 > pyspark实战指南pdf

pyspark实战指南pdf

发布时间:2022-12-12 09:05:06

㈠ 第二篇: 词向量之Spark word2vector实战

word2vector 是google开源的一个生成词向量的工具,以语言模型为优化目标,迭代更新训练文本中的词向量,最终收敛获得词向量。词向量可以作为文本分析中重要的特征,在分类问题、标注问题等场景都有着重要的应用价值。本文总结下了spark word2vector使用过程中遇到的问题,以及给出word2vector使用所需的参数配置,希望能够减少新手在使用过程中遇到的坑,希望有所帮助。

from pyspark.ml.feature import Word2Vec
from pyspark.sql import SQLContext
from pyspark import SparkConf, SparkContext
from pyspark.sql import Row
conf = (SparkConf().set("spark.driver.maxResultSize","2g"))
sc = SparkContext(conf=conf)
sqlContext = SQLContext(sc)
text = sc.textFile("yourfilepath")
documentDF = text.map(lambda x : Row(text=x.split(" "))).toDF()
word2Vec = Word2Vec(vectorSize=200, minCount=5, numPartitions=100,inputCol="text", outputCol="result")
model = word2Vec.fit(documentDF)
vector_model = model.getVectors()
vector_model.saveAsParquetFile("modelpath")

spark-submit
--master yarn-client
--executor-cores 2
--executor-memory 14g
--queue your-queue
--num-executors 100
--driver-memory 10g
--conf spark.ui.port=$RANDOM
--conf spark.shuffle.manager=SORT
--conf spark.shuffle.memoryFraction=0.2
--conf spark.yarn.executor.memoryOverhead=2048
--conf spark.core.connection.ack.wait.timeout=300
--conf spark.akka.frameSize=600 ./word2vector_training.py

阅读全文

与pyspark实战指南pdf相关的资料

热点内容
单片机pc接口 浏览:804
vb程序源码查看修改 浏览:885
华为p8安全加密 浏览:302
模板微信公众网站开发源码 浏览:284
tomcat配置外网服务器地址 浏览:18
光遇服务器2月8日什么时候维护好 浏览:37
php账本源码 浏览:5
清空所有文件夹电脑会出问题吗 浏览:938
读书族小说app哪里找 浏览:346
程序员进公司有什么优势 浏览:642
迅雷文件夹缩写是什么 浏览:279
魔兽宏命令不能最高等级 浏览:159
程序员入职拼多多 浏览:119
pc如何访问服务器配置 浏览:76
pdfpower 浏览:42
linux系统运行级别 浏览:229
android下载文件demo 浏览:949
人体解剖图pdf 浏览:823
php抛出异常处理 浏览:502
java字符串转为对象 浏览:617