1. Download and install JAVA
JDK (jdk-7u75-linux-x64.tar.gz)
2. Install Git
$ sudo apt-get install git
2. Download and install Scala:
$ sudo mkdir /usr/local/scala
$ wget http://www.scala-lang.org/files/archive/scala-2.11.7.deb
$ sudo dpkg -i scala-2.11.7.deb
$ sudo apt-get update
$ sudo apt-get install scala
3. Download and install pre-built Spark:
$ wget http://d3kbcqa49mib13.cloudfront.net/spark-1.2.0-bin-hadoop2.4.tgz
$ tar -xzvf spark-1.2.0-bin-hadoop2.4.tgz
$ sudo mv spark-1.2.0-bin-hadoop2.4 /usr/local/spark
4. Set Environment variables:
export JAVA_HOME=/usr/lib/jvm/java-7-openjdk-amd64
export PATH=$PATH:$JAVA_HOME/bin
#export SCALA_HOME=/usr/local/scala -> Do not set path for Scala
#export PATH=$PATH:$SCALA_HOME/bin -> Do not set path for Scala
export SPARK_HOME=/usr/local/spark
export PATH=$PATH:$SPARK_HOME/bin
5. Launch Spark shell with a Scala interpreter:
$ spark-shell
6. Run Spark to use the Python interpreter:
$ pyspark
7. Download IDE:
IntelliJ IDEA 14.1.1
References:
https://youtu.be/L5QWO8QBG5c
http://blog.prabeeshk.com/blog/2014/10/31/install-apache-spark-on-ubuntu-14-dot-04/
http://stackoverflow.com/questions/31594937/error-invalid-or-corrupt-jarfile-sbt-sbt-launch-0-13-5-jar/31848979#31848979
Tutorials:
https://www.mapr.com/ebooks/spark/chapter01-introduction.html
https://www.princeton.edu/researchcomputing/computational-hardware/hadoop/spark-tut/
http://blog.knoldus.com/2014/06/04/a-simple-application-in-spark-and-scala/
http://blog.cloudera.com/blog/2014/04/how-to-run-a-simple-apache-spark-app-in-cdh-5/
Interview - Questions and Answers:
http://www.bigdataanalyst.in/category/spark/
Cisco (Internal):
http://iwe.cisco.com/web/naiq-it-infrastrucure/spark
http://iwe.cisco.com/web/bigdata-service/platform
--- *** ---
JDK (jdk-7u75-linux-x64.tar.gz)
2. Install Git
$ sudo apt-get install git
2. Download and install Scala:
$ sudo mkdir /usr/local/scala
$ wget http://www.scala-lang.org/files/archive/scala-2.11.7.deb
$ sudo dpkg -i scala-2.11.7.deb
$ sudo apt-get update
$ sudo apt-get install scala
3. Download and install pre-built Spark:
$ wget http://d3kbcqa49mib13.cloudfront.net/spark-1.2.0-bin-hadoop2.4.tgz
$ tar -xzvf spark-1.2.0-bin-hadoop2.4.tgz
$ sudo mv spark-1.2.0-bin-hadoop2.4 /usr/local/spark
4. Set Environment variables:
export JAVA_HOME=/usr/lib/jvm/java-7-openjdk-amd64
export PATH=$PATH:$JAVA_HOME/bin
#export SCALA_HOME=/usr/local/scala -> Do not set path for Scala
#export PATH=$PATH:$SCALA_HOME/bin -> Do not set path for Scala
export SPARK_HOME=/usr/local/spark
export PATH=$PATH:$SPARK_HOME/bin
5. Launch Spark shell with a Scala interpreter:
$ spark-shell
6. Run Spark to use the Python interpreter:
$ pyspark
7. Download IDE:
IntelliJ IDEA 14.1.1
References:
https://youtu.be/L5QWO8QBG5c
http://blog.prabeeshk.com/blog/2014/10/31/install-apache-spark-on-ubuntu-14-dot-04/
http://stackoverflow.com/questions/31594937/error-invalid-or-corrupt-jarfile-sbt-sbt-launch-0-13-5-jar/31848979#31848979
Tutorials:
https://www.mapr.com/ebooks/spark/chapter01-introduction.html
https://www.princeton.edu/researchcomputing/computational-hardware/hadoop/spark-tut/
http://blog.knoldus.com/2014/06/04/a-simple-application-in-spark-and-scala/
http://blog.cloudera.com/blog/2014/04/how-to-run-a-simple-apache-spark-app-in-cdh-5/
Interview - Questions and Answers:
http://www.bigdataanalyst.in/category/spark/
Cisco (Internal):
http://iwe.cisco.com/web/naiq-it-infrastrucure/spark
http://iwe.cisco.com/web/bigdata-service/platform
--- *** ---
No comments:
Post a Comment