To wersja testowa nowego serwisu infoShare Academy — wyświetlane treści i oferta nie są wiążące ani kompletne

Data

PySpark

PySpark to biblioteka dla Apache Spark, która umożliwia tworzenie i uruchamianie zadań rozproszonych na klastrach w języku Python.

Czas trwania
32h · 4 dni
Dla kogo

Idealny dla zespołów, które…

1 Dla programistów ze znajomością języka Python
2 Dla osób, które chcą poznać jedno z najpopularniejszych narzędzi do przetwarzania danych.
3 Dla analityków ze znajomością języka Python.
4 Dla specjalistów Data Scientist.
Efekty po programie

Praktyczne warsztaty z AI i analityki danych — na realnych przypadkach Twojego zespołu.

Zastosowań Apache Spark w organizacji oraz miejsca technologii Big Data w ekosystemie danych

Pracy z danymi w PySpark: RDD oraz DataFrame API, transformacje, agregacje, łączenia i operacje okienkowe

Wykorzystania Spark SQL oraz podstaw Spark ML w zadaniach analitycznych (pipeline, walidacja, metryki)

Uruchamiania, testowania i optymalizacji zadań (zasoby klastra, partycjonowanie, cache, konfiguracja, Structured Streaming)Moduł 1 – Architektura Apache Spark – miejsce w ekosystemie Big Data • Komponenty klastra Spark • Model wykonania driver/executor • Tryby uruchomienia i zarządzanie zasobami • Podstawy bezpieczeństwa danych i sekretów Moduł 2 – RDDs – podstawy przetwarzania rozproszonego w Apache Spark • Transformacje i akcje RDD • Partycjonowanie i trwałość danych • Broadcast variables i akumulatory • Zastosowania RDD vs DataFrame Moduł 3 – Różnice składni Pythona i PySparka; RDD a Pandas DataFrame • Typy danych i schematy • Serializacja i koszty wykonania w Python worker • Interoperacyjność Spark ↔ pandas (Arrow) • Pułapki wydajności (collect, toPandas, skew) Moduł 4 – Zmienne, partycjonowanie oraz zagadnienia Spark Project Core • DAG i lazy evaluation • Cache/persist i poziomy przechowywania • Shuffle, skew i praktyki minimalizacji kosztów • Konfiguracja Spark i parametry uruchomieniowe Moduł 5 – Spark SQL (praca na DF, składnia, schematy, joiny, agregacje) • DataFrame API i Spark SQL • Schematy, typy i nullability • Strategie joinów i optymalizacja • Funkcje okienkowe i agregacje Moduł 6 – Spark ML • Przegląd MLlib i pipeline ML • Inżynieria cech w Spark • Walidacja i strojenie (CV) • Metryki jakości i ryzyko data leakage Moduł 7 – Prototypowanie • Notebooki i środowiska uruchomieniowe • Konfiguracja sesji i reproducibility • Wersjonowanie kodu i zależności • Artefakty uruchomień (logi, metryki, modele) Moduł 8 – Uruchamianie i zarządzanie zadaniami w klastrze • spark-submit i konfiguracja jobów • Dobór zasobów (executors/cores/memory) • Kolejkowanie i izolacja środowisk • Integracja z orkiestracją i harmonogramowaniem Moduł 9 – Testowanie procesów • Testy transformacji danych • Testy jakości danych i reguły walidacji • Deterministyczność wyników i kontrola losowości • Testy wydajności i benchmarki Moduł 10 – Optymalizacja i konfiguracja zadań • Spark UI i analiza planu wykonania • AQE i optymalizacje Catalyst • Format danych i partycjonowanie (I/O) • Koszty shuffle i praktyki ograniczania przestojów Moduł 11 – Spark Structured Streaming • Źródła i ujścia danych strumieniowych • Okna czasowe i watermarks • Semantyka przetwarzania i opóźnienia • Checkpointing i obsługa błędów Moduł 12 – Sesja Q&A • Przegląd pytań i problemów uczestników • Dyskusja rozwiązań i alternatyw • Rekomendacje dalszych kroków rozwoju • Podsumowanie kluczowych praktyk i pułapek

Program · 12 modułów

Co konkretnie robimy

M01
Moduł 1 – Architektura Apache Spark – miejsce w ekosystemie Big Data
  • · Komponenty klastra Spark
  • · Model wykonania driver/executor
  • · Tryby uruchomienia i zarządzanie zasobami
  • · Podstawy bezpieczeństwa danych i sekretów
M02
Moduł 2 – RDDs – podstawy przetwarzania rozproszonego w Apache Spark
  • · Transformacje i akcje RDD
  • · Partycjonowanie i trwałość danych
  • · Broadcast variables i akumulatory
  • · Zastosowania RDD vs DataFrame
M03
Moduł 3 – Różnice składni Pythona i PySparka – RDD a Pandas DataFrame
  • · Typy danych i schematy • Serializacja i koszty wykonania w Python worker
  • · Interoperacyjność Spark ↔ pandas (Arrow)
  • · Pułapki wydajności (collect, toPandas, skew)
M04
Moduł 4 – Zmienne, partycjonowanie oraz zagadnienia Spark Project Core
  • · DAG i lazy evaluation
  • · Cache/persist i poziomy przechowywania
  • · Shuffle, skew i praktyki minimalizacji kosztów
  • · Konfiguracja Spark i parametry uruchomieniowe
M05
Moduł 5 – Spark SQL (praca na DF, składnia, schematy, joiny, agregacje)
  • · DataFrame API i Spark SQL
  • · Schematy, typy i nullability
  • · Strategie joinów i optymalizacja
  • · Funkcje okienkowe i agregacje
M06
Moduł 6 – Spark ML
  • · Przegląd MLlib i pipeline ML
  • · Inżynieria cech w Spark
  • · Walidacja i strojenie (CV)
  • · Metryki jakości i ryzyko data leakage
M07
Moduł 7 – Prototypowanie
  • · Notebooki i środowiska uruchomieniowe
  • · Konfiguracja sesji i reproducibility
  • · Wersjonowanie kodu i zależności
  • · Artefakty uruchomień (logi, metryki, modele)
M08
Moduł 8 – Uruchamianie i zarządzanie zadaniami w klastrze
  • · spark-submit i konfiguracja jobów
  • · Dobór zasobów (executors/cores/memory)
  • · Kolejkowanie i izolacja środowisk
  • · Integracja z orkiestracją i harmonogramowaniem
M09
Moduł 9 – Testowanie procesów
  • · Testy transformacji danych
  • · Testy jakości danych i reguły walidacji
  • · Deterministyczność wyników i kontrola losowości
  • · Testy wydajności i benchmarki
M10
Moduł 10 – Optymalizacja i konfiguracja zadań
  • · Spark UI i analiza planu wykonania
  • · AQE i optymalizacje Catalyst
  • · Format danych i partycjonowanie (I/O)
  • · Koszty shuffle i praktyki ograniczania przestojów
M11
Moduł 11 – Spark Structured Streaming
  • · Źródła i ujścia danych strumieniowych
  • · Okna czasowe i watermarks
  • · Semantyka przetwarzania i opóźnienia
  • · Checkpointing i obsługa błędów
M12
Moduł 12 – Sesja Q&A
  • · Przegląd pytań i problemów uczestników
  • · Dyskusja rozwiązań i alternatyw
  • · Rekomendacje dalszych kroków rozwoju
  • · Podsumowanie kluczowych praktyk i pułapek
Każdy moduł modyfikujemy pod Twój stack i kontekst. Powyższe to punkt wyjścia — nie sztywna agenda.
Jak pracujemy

Od briefu do retro w 30 dniach.

01

Brief i diagnoza

Rozmowa z liderem zespołu + krótka ankieta dla uczestników. Określamy cele, gap, kontekst.

02

Modyfikacja programu

Dostosowujemy moduły, case studies i przykłady kodu pod Twój stack. Akceptacja w 5 dni.

03

Warsztat

Sesje z trenerem, hands-on, code review. Mentor dostępny też pomiędzy sesjami.

04

Retro + raport

Raport z efektami dla zespołu i lidera. 30 dni konsultacji w cenie.

Zapytanie

Wyślij brief. Odezwiemy się w 1 dzień.

Po krótkim briefie przygotujemy program i wycenę. Bez zobowiązań — to tylko punkt wyjścia do rozmowy.

Wycena w 48h od briefu
Pierwsza sesja w 30 dni
Pilotaż przed pełną decyzją
Faktura VAT, możliwość płatności w transzach

Co robimy z Twoimi danymi

Dane służbowe (imię, e-mail firmowy, telefon, firma, stanowisko) przetwarzamy w celu obsługi zapytania o szkolenie dla firmy i przygotowania oferty. Administratorem danych jest infoShare Academy Sp. z o.o., Al. Grunwaldzka 472B, 80-309 Gdańsk. Podanie danych jest dobrowolne, ale niezbędne do udzielenia odpowiedzi. Masz prawo dostępu do danych, ich sprostowania, usunięcia, ograniczenia przetwarzania i wniesienia sprzeciwu. Pełną informację znajdziesz w Klauzuli informacyjnej.

Zgody marketingowe (dobrowolne)

Administratorem danych osobowych jest infoShare Academy sp. z o.o. Zasady przetwarzania danych osobowych znajdują się w dokumentach Polityka Prywatności oraz Klauzula Informacyjna.