Please enable JavaScript.
Coggle requires JavaScript to display documents.
spark et Hadoop - Coggle Diagram
spark et Hadoop
APACHE SPARK
Pourquoi Spark ?
100x plus performant
Développement rapide
Scala, Java, Python, R
Big Data unifié
Exécution partout
Cas d'utilisation
Volume
Velocity
Variety
Data Analyst
Data Scientist
Data Engineer
Architecture
Driver
SparkSession
Executors
Tasks
Cache
Cluster Manager
Spark Stack
Spark Core
Spark SQL
Spark Streaming
MLlib
GraphX
SparkR
Modes d'exécution
Local Mode
Cluster Mode
Client Mode
Installation
Java 8
Maven 3
Python 3
Spark 2/3
IntelliJ / Jupyter
Spark Shell
JAVA_HOME
SPARK_HOME
spark-shell
Commandes Scala
Monitoring
Spark UI (port 4040)
Développement
Scala
Java
Maven
IntelliJ
HADOOP & MAPREDUCE
Big Data
Volume
Velocity
Variety
Scalabilité
NoSQL
BASE
Cohérence relâchée
Haute disponibilité
Elasticité
Théorème CAP
Consistency
Availability
Partition Tolerance
Impossible d'avoir les 3 simultanément
Hadoop
HDFS
MapReduce
Hive
Pig
HBase
Sqoop
ZooKeeper
HDFS
NameNode
DataNode
Réplication
Blocs (64/128 Mo)
Tolérance aux pannes
Scalabilité horizontale
MapReduce
Map
Shuffle
Sort
Reduce
Combiner
MapReduce v1
JobTracker
TaskTracker
YARN (MapReduce v2)
Resource Manager
Node Manager
Application Master