Opleiding: Training Hadoop
Wil je een Hadoop-omgeving zelf kunnen opzetten en beheren, zodat grote datasets betrouwbaar opgeslagen en verwerkt blijven, ook als je cluster groeit? In deze training verdiep je je in de architectuur van het Hadoop-framework en richt je zelf een omgeving in, van een standalone server tot een volledig cluster met HDFS. Je regelt resource management, beveiliging en monitoring voor high availability. Hierdoor ben je in staat om een Hadoop-cluster gestructureerd op te zetten en beheersbaar te houden.
Algemene omschrijving
Apache Hadoop is een framework voor gedistribueerde opslag en verwerking van grote datasets. Doordat data over meerdere clusters wordt verdeeld en parallel wordt verwerkt, schaalt het platform goed en verwerkt het grote hoeveelheden data met een hoge fouttolerantie. Hadoop en HDFS zijn nog altijd een stevige keuze voor bestaande on-prem omgevingen waarin je data lokaal beheert. Waar vroeger MapReduce de verwerking verzorgde, is Spark tegenwoordig de gangbare verwerkingsengine naast HDFS als opslaglaag.
Tijdens deze training verdiep je je eerst in de architectuur van het Hadoop-framework en de werking van het ecosysteem. Daarna richt je zelf een omgeving in: je zet een standalone server op en bouwt stap voor stap een volledig cluster. Je duikt de diepte in van HDFS, regelt resource management en beveiliging, en zet monitoring op waarmee je high availability binnen je organisatie waarborgt.
Onze trainers zijn, naast trainer, dagelijks werkzaam op dit expertisegebied. Je mag rekenen op een training waarin we theorie en praktijk afwisselen en aansluiten bij de vraagstukken uit jouw eigen werkpraktijk. Hierdoor ben je in staat om een Hadoop-cluster op te zetten, in te richten en beheersbaar te houden.
Deze training als bedrijfstraining voor jou en je team?
Elk vraagstuk en elke situatie is anders; daarom staan tijdens een bedrijfstraining jouw organisatie en (bedrijfs)vraagstukken centraal. In goed overleg stellen we een lesprogramma samen dat volledig aansluit bij jouw (jullie!) specifieke uitdaging, wensen en dagelijkse werkpraktijk.
Programma
Tijdens de training Hadoop komen onderstaande onderwerpen aan bod.
NB: Mocht je vragen hebben over de inhoud of deze aangepast willen zien op jouw specifieke praktijksituatie of trainingsbehoefte, bel ons dan gerust: we spreken de mogelijkheden graag met je door.
- Achtergrond en architectuur van Hadoop
-
- De werking van Apache Hadoop en de opzet van het ecosysteem doorgronden
- Herkennen hoe gedistribueerde opslag en parallelle verwerking samenhangen
- De juiste Hadoop-distributie kiezen, waarbij het distributielandschap inmiddels rond Cloudera is geconsolideerd
- Bepalen wanneer Hadoop en HDFS passen bij een bestaande on-prem omgeving
- Clusters plannen en opzetten
-
- De technische vereisten en randvoorwaarden voor een Hadoop-setup vaststellen
- Hadoop in standalone mode draaien
- Een pseudo-cluster opzetten als oefenomgeving
- Een cluster plannen en de juiste sizing bepalen
- Hadoop in cluster mode installeren en configureren
- Een draaiend cluster diagnosticeren bij problemen
- Verdieping in het Hadoop Distributed File System (HDFS)
-
- Doorgronden hoe HDFS werkt en welke kenmerken het onderscheiden
- De data flow-patronen binnen HDFS herkennen
- De configuratiebestanden van HDFS instellen
- Werken met de filesystem-CLI's van Hadoop
- Datastructuren binnen HDFS opzetten en beheren
- Beheer en administratie van een cluster
-
- De rollen en verantwoordelijkheden van een Hadoop-beheerder bepalen
- Een gedistribueerd cluster plannen
- Resource management in Hadoop inrichten
- High availability voor je cluster opzetten
- Routinetaken voor het beheer uitvoeren
- Monitoring en beveiliging
-
- Algemene monitoring van je cluster opzetten
- Security monitoring inrichten om afwijkingen te signaleren
- Hadoop-clusters beveiligen tegen ongewenste toegang
- Monitoring inzetten om high availability te bewaken
De training is praktisch en interactief van opzet, met veel ruimte voor jouw vragen en werksituatie. Je gaat aan de slag met passende praktijkvoorbeelden. Door actief te oefenen, te analyseren en te evalueren, maak je je de materie stap voor stap eigen en ervaar je hoe je een Hadoop-omgeving opzet, inricht en monitort.
Onze trainers zijn, naast trainer, dagelijks werkzaam op dit expertisegebied. Ze beschikken dus niet alleen over de meest actuele kennis, maar hebben ook essentiële praktijkervaring. Hierdoor zijn ze in staat om een waardevolle vertaalslag te maken van ‘kennis’ naar ‘toepassing binnen jouw organisatie en werksituatie’.
Doelen
Na deze training ben je in staat om:
- De architectuur en werking van het Hadoop-framework te doorgronden
- Een Hadoop-omgeving te installeren en te configureren, van standalone server tot volledig cluster
- HDFS in te richten en te beheren met de juiste configuratiebestanden en CLI's
- Resource management, beveiliging en routinetaken voor je cluster te verzorgen
- Monitoring op te zetten waarmee je high availability voor je cluster waarborgt