Friday, September 11, 2015

Apache Spark installation on Ubuntu 14.04

1. Download and install JAVA
   JDK (jdk-7u75-linux-x64.tar.gz)

2. Install Git
   $ sudo apt-get install git

2. Download and install Scala:
   $ sudo mkdir /usr/local/scala
   $ wget http://www.scala-lang.org/files/archive/scala-2.11.7.deb
   $ sudo dpkg -i scala-2.11.7.deb
   $ sudo apt-get update
   $ sudo apt-get install scala

3. Download and install pre-built Spark:
   $ wget http://d3kbcqa49mib13.cloudfront.net/spark-1.2.0-bin-hadoop2.4.tgz
   $ tar -xzvf spark-1.2.0-bin-hadoop2.4.tgz
   $ sudo mv spark-1.2.0-bin-hadoop2.4 /usr/local/spark

4. Set Environment variables:
   export JAVA_HOME=/usr/lib/jvm/java-7-openjdk-amd64
   export PATH=$PATH:$JAVA_HOME/bin
   
   #export SCALA_HOME=/usr/local/scala -> Do not set path for Scala
   #export PATH=$PATH:$SCALA_HOME/bin -> Do not set path for Scala
   
   export SPARK_HOME=/usr/local/spark
   export PATH=$PATH:$SPARK_HOME/bin

5. Launch Spark shell with a Scala interpreter:
   $ spark-shell

6. Run Spark to use the Python interpreter:
   $ pyspark

7. Download IDE:
   IntelliJ IDEA  14.1.1



References:
  https://youtu.be/L5QWO8QBG5c
  http://blog.prabeeshk.com/blog/2014/10/31/install-apache-spark-on-ubuntu-14-dot-04/
  http://stackoverflow.com/questions/31594937/error-invalid-or-corrupt-jarfile-sbt-sbt-launch-0-13-5-jar/31848979#31848979

 

Tutorials:
  https://www.mapr.com/ebooks/spark/chapter01-introduction.html
  https://www.princeton.edu/researchcomputing/computational-hardware/hadoop/spark-tut/
  http://blog.knoldus.com/2014/06/04/a-simple-application-in-spark-and-scala/
  http://blog.cloudera.com/blog/2014/04/how-to-run-a-simple-apache-spark-app-in-cdh-5/


Interview - Questions and Answers:
  http://www.bigdataanalyst.in/category/spark/
 

Cisco (Internal):
  http://iwe.cisco.com/web/naiq-it-infrastrucure/spark
  http://iwe.cisco.com/web/bigdata-service/platform


--- *** ---

No comments:

Post a Comment