sbtspark源码_怎么用Eclipse搭建Spark源码阅读环境

① 怎么用Eclipse搭建Spark源码阅读环境

第一部分、软件安装

1、安装JDK （版本为1.7.0_11）

2、安装Scala （版本为2.11.2）

3、安装ScalaIDE（版本为3.0.4）

第二部分：加压缩官网下载的源代码包或者找到通过Git抽取的Spark源文件：

我用的是spark-1.1.1版本（最新版本），由于idea 13已经原生支持sbt，所以无须为idea安装sbt插件。

源码下载(用git工具)：

# Masterdevelopment branch

gitclone git://github.com/apache/spark.git

# 1.1 maintenancebranch with stability fixes on top of Spark 1.1.1

gitclone git://github.com/apache/spark.git -b branch-1.1

源码更新（用git工具同步跟新源码）：

gitclone https://github.com/apache/spark.git

第三部分：通过sbt工具，构建Scala的Eclipse工程，详细步骤如下所示

1、通过cmd命令进入DOS界面，之后通过cd命令进入源代码项目中，我下载的Spark.1.1.1版本的源代码放在（E:\Spark计算框架的研究\spark_1_1_1_eclipse）文件夹中，之后运行sbt命令，如下所示：

2、运行sbt命令之后，解析编译相关的jar包，并出现sbt命令界面窗口，出现的效果图如下所示，之后运行eclipse命令，sbt对这个工程进行编译，构建Eclipse项目，效果图如下所示：

4、打开ScalaIDE工具，File à Import à Existing Projects into Workspace à
Next à
选择刚好用sbt工具编译好的Eclipse工程（E:\Spark计算框架的研究\spark_1_1_1_eclipse），如下图所示。

5、通过上面的操作，就可以将通过sbt工具编译生成的Eclipse项目导入到EclipseIDE开发环境中，效果图如下所示：

错误提示如下所示：我导入的包为，如下文件夹中所示。

（E:\Spark计算框架的研究\spark_1_1_1_eclipse\lib_managed\bundles）

Description Resource Path Location Type

akka-remote_2.10-2.2.3-shaded-protobuf.jar is cross-compiled

with an incompatible version of Scala (2.10).

In case of errorneous report, this check can be disabled

in the compiler preference page.

spark-core Unknown Scala Classpath Problem

Description Resource Path Location Type

akka-slf4j_2.10-2.2.3-shaded-protobuf.jar is cross-compiled with

an incompatible version of Scala (2.10). In case of errorneous report,

this check can be disabled in the compiler preference page.

spark-core Unknown Scala Classpath Problem

Description Resource Path Location Type

akka-testkit_2.10-2.2.3-shaded-protobuf.jar is cross-compiled

with an incompatible version of Scala (2.10).

In case of errorneous report, this check can be disabled in the compiler preference page.

spark-core Unknown Scala Classpath Problem

Description Resource Path Location Type

akka-zeromq_2.10-2.2.3-shaded-protobuf.jar is cross-compiled

with an incompatible version of Scala (2.10).

In case of errorneous report, this check can be disabled in the compiler preference page.

spark-core Unknown Scala Classpath Problem

上面这些包兼容性问题还没有解决，修改相应的jar包就可以解决。

② Spark 中用 Scala 和 java 开发有什么区别

1，构建系统的选择，sbt更合适用来构建Scala工程，maven更合适用来构建Java工程
2，对于spark中的API来说，Java和Scala有差别，但差别并不大
3，如果用Scala开发spark原型程序，可以用spark-shell“打草稿”，或者直接使用spark-shell做交互式实时查询
4，用Scala代码量将减少甚至一个数量级，不过Scala的使用门槛较高
建议：使用Scala构建spark作业，因为spark本身为sbt所构建，同时使用Scala开发spark作业将有助于理解spark的实现机制

③ 虚拟机spark中怎样导入数据,的代码

具体操作步骤：
1、准备Spark程序目录结构。
2、编辑build.sbt配置文件添加依赖。
3、创建WriteToCk.scala数据写入程序文件。
4、编译打包。
5、运行。
参数说明：your-user-name：目标ClickHouse集群中创建的数据库账号名。
your-pasword：数据库账号名对应的密码。
your-url：目标ClickHouse集群地址。
/your/path/to/test/data/a.txt：要导入的数据文件的路径，包含文件地址和文件名。说明文件中的数据及schema，需要与ClickHouse中目标表的结构保持一致。
your-table-name：ClickHouse集群中的目标表名称。

④ 怎么用Eclipse搭建Spark源码阅读环境

应该说这个和是不是Spark项目没什么关系。

建议你使用intellij idea，在spark目录下执行"sbt/sbt gen-idea"，会自动生成.idea项目，导入即可。
idea我不熟，还需要做一些其他的插件配置(python, sbt等)和环境设置。

你也可以使用Eclipse看，Eclipse有scala IDE，把Spark项目当maven工程导入。但是子项目之间的依赖会有点问题，会报错。

推荐使用前者，向Databricks的开发者看齐；我使用的是后者，我直接依赖了编译好的包就不会报错了，纯读源码的话也勉强可以跟踪和调试。

另外，我也看有的Committer用vim看spark代码的，所以怎么看源码都无所谓，你熟悉就好，而且这和是不是Spark项目也没什么关系。:)

⑤ 硕士毕业论文想做Spark相关的内容，大牛有什么好idea可以推荐吗

。 IntelliJ IDEA 13已经不需要事先sbt gen-idea了，直接打开源码目录，IntelliJ会自动识别SBT项目并导入。不过我一般还是习惯先sbt gen-idea一下。不是搞spark源码阅读的话，直接二进制吧，里边有spark-assembly-1.0.1-hadoop2.2.0.ja

⑥ 如何使用intellij搭建spark开发环境

注意，客户端和虚拟集群中hadoop、spark、scala的安装目录是一致的，这样开发的spark应用程序的时候不需要打包spark开发包和scala的库文件，减少不必要的网络IO和磁盘IO。当然也可以不一样，不过在使用部署工具spark-submit的时候需要参数指明classpath。
1：IDEA的安装
官网jetbrains.com下载IntelliJ IDEA，有Community Editions 和& Ultimate Editions，前者免费，用户可以选择合适的版本使用。
根据安装指导安装IDEA后，需要安装scala插件，有两种途径可以安装scala插件：
启动IDEA -> Welcome to IntelliJ IDEA -> Configure -> Plugins -> Install JetBrains plugin... -> 找到scala后安装。
启动IDEA -> Welcome to IntelliJ IDEA -> Open Project -> File -> Settings -> plugins -> Install JetBrains plugin... -> 找到scala后安装。

如果你想使用那种酷酷的黑底界面，在File -> Settings -> Appearance -> Theme选择Darcula，同时需要修改默认字体，不然菜单中的中文字体不能正常显示。2：建立Spark应用程序
下面讲述如何建立一个Spark项目week2（，正在录制视频），该项目包含3个object：
取自spark examples源码中的SparkPi
计词程序WordCount1
计词排序程序WordCount2

A：建立新项目
创建名为dataguru的project：启动IDEA -> Welcome to IntelliJ IDEA -> Create New Project -> Scala -> Non-SBT -> 创建一个名为week2的project（注意这里选择自己安装的JDK和scala编译器） -> Finish。
设置week2的project structure
增加源码目录：File -> Project Structure -> Meles -> week2，给week2创建源代码目录和资源目录，注意用上面的按钮标注新增加的目录的用途。

增加开发包：File -> Project Structure -> Libraries -> + -> java -> 选择
/app/hadoop/spark100/lib/spark-assembly-1.0.0-hadoop2.2.0.jar
/app/scala2104/lib/scala-library.jar可能会提示错误，可以根据fix提示进行处理

B：编写代码
在源代码scala目录下创建1个名为week2的package，并增加3个object（SparkPi、WordCoun1、WordCount2）：

SparkPi代码
package week2

import scala.math.random
import org.apache.spark._

/** Computes an approximation to pi */
object SparkPi {
def main(args: Array[String]) {
val conf = new SparkConf().setAppName("Spark Pi")
val spark = new SparkContext(conf)
val slices = if (args.length > 0) args(0).toInt else 2
val n = 100000 * slices
val count = spark.parallelize(1 to n, slices).map { i =>
val x = random * 2 - 1
val y = random * 2 - 1
if (x*x + y*y < 1) 1 else 0
}.rece(_ + _)
println("Pi is roughly " + 4.0 * count / n)
spark.stop()
}
}
复制代码

WordCount1代码

package week2

import org.apache.spark.{SparkContext, SparkConf}
import org.apache.spark.SparkContext._

object WordCount1 {
def main(args: Array[String]) {
if (args.length == 0) {
System.err.println("Usage: WordCount1 <file1>")
System.exit(1)
}

val conf = new SparkConf().setAppName("WordCount1")
val sc = new SparkContext(conf)
sc.textFile(args(0)).flatMap(_.split(" ")).map(x => (x, 1)).receByKey(_ + _).take(10).foreach(println)
sc.stop()
}
}
复制代码

WordCount2代码

package week2

import org.apache.spark.{SparkContext, SparkConf}
import org.apache.spark.SparkContext._

object WordCount2 {
def main(args: Array[String]) {
if (args.length == 0) {
System.err.println("Usage: WordCount2 <file1>")
System.exit(1)
}

val conf = new SparkConf().setAppName("WordCount2")
val sc = new SparkContext(conf)
sc.textFile(args(0)).flatMap(_.split(" ")).map(x => (x, 1)).receByKey(_ + _).map(x=>(x._2,x._1)).sortByKey(false).map(x=>(x._2,x._1)).take(10).foreach(println)
sc.stop()
}
}
复制代码

C：生成程序包
生成程序包之前要先建立一个artifacts，File -> Project Structure -> Artifacts -> + -> Jars -> From moudles with dependencies，然后随便选一个class作为主class。

按OK后，对artifacts进行配置，修改Name为week2，删除Output Layout中week2.jar中的几个依赖包，只剩week2项目本身。

按OK后， Build -> Build Artifacts -> week2 -> rebuild进行打包，经过编译后，程序包放置在out/artifacts/week2目录下，文件名为week2.jar。

3：Spark应用程序部署
将生成的程序包week2.jar复制到spark安装目录下，切换到用户hadoop，然后切换到/app/hadoop/spark100目录，进行程序包的部署。具体的部署参见应用程序部署工具spark-submit 。

⑦ 怎样在 intelliJ 中开发 spark 应用

IntelliJ IDEA 13已经不需要事先sbt gen-idea了，直接打开源码目录，IntelliJ会自动识别SBT项目并导入。不过我一般还是习惯先sbt gen-idea一下。
不是搞spark源码阅读的话，直接下载二进制吧，里边有spark-assembly-1.0.1-hadoop2.2.0.jar，添加lib，就可以欢快的写spark应用了
~如果你认可我的回答，请及时点击【采纳为满意回答】按钮
~~手机提问的朋友在客户端右上角评价点【满意】即可。

⑧ AIUI.jar在项目文件中要解压吗

网上搜一下就有，下面转的董西成的博客（1）准备工作1）安装JDK 6或者JDK 72）安装scala 2.10.x (注意版本)3）将的Intellij IDEA解压后，安装scala插件，流程如下：依次选择“Configure”–> “Plugins”–> “Browse repositories”，输入scala，然后安装即可（2）搭建Spark源码阅读环境（需要联网）第一种方法是直接依次选择“import project”–> 选择spark所在目录 –> “SBT”，之后intellij会自动识别SBT文件，并依赖的外部jar包，整个流程用时非常长，取决于机器的网络环境（不建议在windows下操作，可能遇到各种问题），一般需花费几十分钟到几个小时。注意，过程会用到git，因此应该事先安装了git。第二种方法是首先在linux操作系统上生成intellij项目文件，然后在intellij IDEA中直接通过“Open Project”打开项目即可。在linux上生成intellij项目文件的方法（需要安装git，不需要安装scala，sbt会自动）是：在spark源代码根目录下，输入sbt/sbt gen-idea注：如果你在windows下阅读源代码，建议先在linux下生成项目文件，然后导入到windows中的intellij IDEA中。（3）搭建Spark开发环境在intellij IDEA中创建scala project，并依次选择“File”–> “project structure” –> “Libraries”，选择“+”，将spark-hadoop 对应的包导入，比如导入spark-assembly_2.10-0.9.0-incubating-hadoop2.2.0.jar（只需导入该jar包，其他不需要），如果IDE没有识别scala 库，则需要以同样方式将scala库导入。之后开发scala程序即可：编写完scala程序后，可以直接在intellij中，以local模式运行，方法如下：点击“Run”–> “Run Configurations”，在弹出的框中对应栏中填写“local”，表示将该参数传递给main函数，如下图所示，之后点击“Run”–> “Run”运行程序即可。如果想把程序打成jar包，通过命令行的形式运行在spark 集群中，可以按照以下步骤操作：依次选择“File”–> “Project Structure” –> “Artifact”，选择“+”–> “Jar” –> “From Moles with dependencies”，选择main函数，并在弹出框中选择输出jar位置，并选择“OK”。最后依次选择“Build”–> “Build Artifact”编译生成jar包。

⑨ 如何在mac上搭建spark环境

（1）准备工作

1）安装JDK 6或者JDK 7

2）安装scala 2.10.x (注意版本)

2）下载Intellij IDEA最新版（本文以IntelliJ IDEA Community Edition 13.1.1为例说明，不同版本，界面布局可能不同）

3）将下载的Intellij IDEA解压后，安装scala插件，流程如下：

依次选择“Configure”–> “Plugins”–> “Browse repositories”，输入scala，然后安装即可

（2）搭建Spark源码阅读环境（需要联网）

一种方法是直接依次选择“import project”–> 选择spark所在目录 –>
“SBT”，之后intellij会自动识别SBT文件，并下载依赖的外部jar包，整个流程用时非常长，取决于机器的网络环境（不建议在windows
下操作，可能遇到各种问题），一般需花费几十分钟到几个小时。注意，下载过程会用到git，因此应该事先安装了git。

第二种方法是首先在linux操作系统上生成intellij项目文件，然后在intellij IDEA中直接通过“Open
Project”打开项目即可。在linux上生成intellij项目文件的方法（需要安装git，不需要安装scala，sbt会自动下载）是：在
spark源代码根目录下，输入sbt/sbt gen-idea

注：如果你在windows下阅读源代码，建议先在linux下生成项目文件，然后导入到windows中的intellij IDEA中。

（3）搭建Spark开发环境

在intellij IDEA中创建scala project，并依次选择“File”–> “project structure”
–> “Libraries”，选择“+”，将spark-hadoop
对应的包导入，比如导入spark-assembly_2.10-0.9.0-incubating-hadoop2.2.0.jar（只需导入该jar
包，其他不需要），如果IDE没有识别scala 库，则需要以同样方式将scala库导入。之后开发scala程序即可：

编写完scala程序后，可以直接在intellij中，以local模式运行，方法如下：

点击“Run”–> “Run Configurations”，在弹出的框中对应栏中填写“local”，表示将该参数传递给main函数，如下图所示，之后点击“Run”–> “Run”运行程序即可。

如果想把程序打成jar包，通过命令行的形式运行在spark 集群中，可以按照以下步骤操作：

依次选择“File”–> “Project Structure” –> “Artifact”，选择“+”–>
“Jar” –> “From Moles with
dependencies”，选择main函数，并在弹出框中选择输出jar位置，并选择“OK”。

最后依次选择“Build”–> “Build Artifact”编译生成jar包。

导航:首页 > 源码编译 > sbtspark源码

sbtspark源码

与sbtspark源码相关的资料