Главный продукт

DE-практикум: собрать пайплайн, который можно показать

Сквозной проект для Junior / Middle: RAW, STG, CORE, MARTS, Spark jobs, Airflow DAG, проверки качества и BI-витрина. Не пересказ документации, а рабочий контур данных руками.

Старт 10 августа 2026
Стоимость 35 000 ₽
Spark + Airflow + BI 6-8 часов в неделю Stepik + GitHub навсегда Telegram до полного прохождения
Медведь за рабочим столом с пайплайном Data Engineering
Что останется

На выходе: рабочий контур данных

После практикума у вас остается проект, который можно открыть, запустить и показать: репозиторий, DWH-слои, Airflow DAG и BI-витрина. В эти рамки можно вставить реальные скрины из практикума.

Диагностика

Сначала проверим вход, потом решим маршрут

Шесть коротких вопросов: цель, SQL, Python, понимание кода, окружение и время. В конце получите маршрут: практикум сейчас, добор базы или следующий поток.

Короткий тест - диагностика

Нормальная диагностика не должна заваливать. Она нужна, чтобы дорогой практикум не превратился в борьбу с SQL, Python или Docker.

Вопрос 1 из 6

Маршрут

Открыть курс
Внутри практикума

Вы работаете не с презентацией, а с локальным стендом

В практикуме важны рабочие экраны: репозиторий, локальный стенд, запуск Spark jobs, Airflow DAG, DWH-слои и BI-витрина.

GitHubrepo
course/dags/spark_jobs/sql/marts/

Репозиторий

Код, README, структура проекта и история изменений остаются у вас.

Dockerservices up
postgresairflowsparkmetabase

Локальный стенд

Поднимаете сервисы и учитесь читать состояние окружения, а не угадывать.

Sparkjob finished
spark-submit jobs/build_core.py rows written: 128430

Spark jobs

Пишете batch-обработку и видите, где ломаются схемы, типы и данные.

Airflowsuccess
rawstgcoremarts

Airflow DAG

Пайплайн запускается графом, с зависимостями, ретраями и логами.

Postgresdwh
core.orderscore.customersmarts.sales_daily

DWH-слои

Собираете таблицы с понятным зерном, связями и проверками качества.

Metabasedashboard

BI-витрина

Финальный результат можно открыть и показать, а не только описать словами.

Стек

Инструменты связаны в один контур

Каждый сервис отвечает за свой кусок результата: хранение сырья, обработку, DWH-слои, оркестрацию и витрину. Так стек перестает быть списком названий и становится рабочей системой.

Docker-стенд

Собирает сервисы в одну локальную среду: код, хранилище, обработку, базу, оркестрацию и BI.

GitHub

Код, README и история проекта.

MinIO, S3 API

RAW и промежуточные файлы.

Spark

Batch-трансформации и проверки.

Postgres

DWH-слои и витрины данных.

Airflow

DAG, логи, ретраи и расписание.

Jupyter

Проверка логики и результатов.

Metabase

Витрина и метрики для бизнеса.

Маршрут проекта

От сырья до витрины: один проект, несколько слоев

Каждый этап добавляет новый слой проекта: среду, сырье, очистку, ядро, витрины, проверки, оркестрацию и BI. Так маршрут читается как один рабочий пайплайн.

01

Стенд

Поднять сервисы, проверить подключения, увидеть рабочую структуру проекта.

02

RAW

Загрузить исходные файлы и зафиксировать правила входного слоя.

03

STG

Очистить типы, даты, дубли и строки, которые ломают дальнейшую обработку.

04

CORE

Собрать связи, ключи и устойчивую модель, на которую можно опираться.

05

MARTS

Подготовить витрины под вопросы бизнеса, метрики и дальнейшую BI-историю.

06

Checks

Добавить проверки качества, reconciliation и понятные сигналы об ошибках.

07

Airflow

Собрать DAG, зависимости, логику запуска и повторное выполнение.

08

BI

Показать результат в витрине и уметь объяснить путь данных до цифры.

Программа

Темп по неделям, доступ без дедлайна

Маршрут рассчитан на спокойное прохождение по вечерам. Курс на Stepik и приватный GitHub-репозиторий остаются у вас навсегда, а моя поддержка в Telegram-группе работает до полного прохождения.

de_practicum.plan 8 этапов
01

Старт и окружение

Docker, структура проекта, подключение к сервисам, первый smoke-check.

02

Файлы и RAW

Прием сырья, правила хранения, контроль входных данных.

03

STG и очистка

Типы, даты, дубли, пустые поля, ошибки формата и rejected rows.

04

Spark jobs

Чтение, трансформации, запись, параметры запуска и логи выполнения.

05

CORE-модель

Ключи, связи, факты, измерения и слой, который выдерживает повторный запуск.

06

MARTS

Витрины под аналитику, понятные поля и проверяемый результат.

07

Airflow

DAG, зависимости, retries, логи, запуск пайплайна и контроль падений.

08

BI и защита результата

Дашборд, объяснение логики, ответы на вопросы по проекту.

Формат

Не просто уроки: среда, код и поддержка до результата

Смысл практикума в том, чтобы довести проект до состояния, которое можно открыть, запустить, показать и объяснить. Поэтому доступы и поддержка устроены вокруг прохождения.

Stepik

Курс остается навсегда

Можно вернуться к урокам, перепройти сложный кусок, сверить шаги и восстановить контекст после паузы.

GitHub

Приватный репозиторий навсегда

В репозитории хранится код проекта: структура, DAG, SQL, Spark jobs и инструкции по запуску.

Telegram

Поддержка до полного прохождения

Если пайплайн упал, проверка не сходится или непонятен лог, вопрос можно разобрать в группе.

Проверки

Фокус на рабочем результате

Важны не только правильные ответы, но и повторный запуск, качество данных и понятный путь до BI.

Темп

Можно проходить своим ритмом

Оптимально держать 6-8 часов в неделю, но доступы не исчезают, если график временно просел.

Кому подходит

Практикум для тех, кто готов собирать руками

Это не курс для полного нуля. Здесь нормальная точка входа: базовый SQL, базовый Python и желание разбираться в логах, ошибках и связях между слоями.

Подходит
  • Вы уже решали SQL-задачи и понимаете JOIN, GROUP BY, CTE хотя бы на рабочем уровне.
  • Вы писали Python-скрипты и готовы читать CSV/JSON, чистить строки и запускать код локально.
  • Вы хотите собрать проект, который показывает не только запрос, но и пайплайн целиком.
  • Вам нужен артефакт для собеседования, портфолио или перехода в DE-задачи внутри работы.
Лучше подготовиться
  • SQL пока ломается на JOIN, NULL и группировках.
  • Python пока держится только на учебных примерах без файлов и грязных данных.
  • Вы не готовы поднимать локальный стенд и читать ошибки запуска.
  • Вы ждете пересказа теории вместо проектной работы.
Нормальная развилка

Если база проседает, сначала закрываем SQL или Python. Если база есть, идем в практикум и собираем контур данных.

Отзывы и цифры

Что отмечают участники практикума

Официальные отзывы опубликованы на Stepik. Ниже также оставил обратную связь участников первых потоков.

Официальный отзыв 5 / 5

Сквозной пример обработки данных от RAW до BI-дашбордов с использованием популярного DE-стека. Готовый каркас ETL для собственных проектов, широкий охват инструментов и очень много практики. Удобный чат по каждому разделу, где можно задавать вопросы и получать ответы.

Официальный отзыв 5 / 5

В курсе много практики и минимум теории. После прохождения появилась полная картина работы с данными. Материалы подаются структурированно, четко и с постепенным ростом сложности. На вопросы Дмитрий отвечает оперативно.

Самое полезное можно разделить на две части: навык и инструментарий. По SQL стало понятнее, как работать со схемами, таблицами, индексами и партициями. Хорошо разобраны Airflow, Spark и S3.

Артём участник альфа-потока

До практикума я работала только с этапом, где данные уже загружены. Как они загружаются, преобразуются и собираются в полный цикл, было непонятно. Практикум помог собрать эту картину целиком.

Алина участница альфа-потока
Участие в потоке

Соберите проект в своем темпе и с поддержкой до результата

Стартуем 10 августа. Доступ к курсу и приватному репозиторию остается навсегда, поддержка в Telegram действует до полного прохождения.

Старт 10 августа
Стоимость 35 000 ₽
Нагрузка 6-8 часов в неделю
Что входит

Полный DE-практикум

  • курс на Stepik без ограничения по времени;
  • приватный GitHub-репозиторий проекта навсегда;
  • поддержка в Telegram до полного прохождения;
  • локальный стенд: Docker, Postgres, MinIO, Spark, Airflow и Metabase;
  • сквозной проект от RAW-слоя до BI-витрины;
  • проверки качества, код, DAG и артефакты для портфолио.
Можно ли проходить медленнее потока?

Да. Материалы и репозиторий не сгорают, а поддержка в Telegram сохраняется до полного прохождения.

Что есть в бесплатном демо?

Postgres, Airflow, четыре CSV-файла, слои RAW, STG, CORE и MARTS, проверки качества и HTML-отчет. Это облегченная версия для проверки локального запуска и формата работы.

Что делать, если SQL или Python пока слабые?

Сначала закрыть базу отдельным маршрутом. Практикум опирается на рабочий SQL и базовый Python, чтобы основное время уходило на инженерный проект.

Нужен ли коммерческий опыт в Data Engineering?

Нет. Нужны базовые SQL и Python, готовность поднять локальный стенд и разбирать ошибки по логам.