course/dags/spark_jobs/sql/marts/ Репозиторий
Код, README, структура проекта и история изменений остаются у вас.
Сквозной проект для Junior / Middle: RAW, STG, CORE, MARTS, Spark jobs, Airflow DAG, проверки качества и BI-витрина. Не пересказ документации, а рабочий контур данных руками.
После практикума у вас остается проект, который можно открыть, запустить и показать: репозиторий, DWH-слои, Airflow DAG и BI-витрина. В эти рамки можно вставить реальные скрины из практикума.
Шесть коротких вопросов: цель, SQL, Python, понимание кода, окружение и время. В конце получите маршрут: практикум сейчас, добор базы или следующий поток.
Нормальная диагностика не должна заваливать. Она нужна, чтобы дорогой практикум не превратился в борьбу с SQL, Python или Docker.
В практикуме важны рабочие экраны: репозиторий, локальный стенд, запуск Spark jobs, Airflow DAG, DWH-слои и BI-витрина.
course/dags/spark_jobs/sql/marts/ Код, README, структура проекта и история изменений остаются у вас.
Поднимаете сервисы и учитесь читать состояние окружения, а не угадывать.
spark-submit jobs/build_core.py rows written: 128430 Пишете batch-обработку и видите, где ломаются схемы, типы и данные.
Пайплайн запускается графом, с зависимостями, ретраями и логами.
Собираете таблицы с понятным зерном, связями и проверками качества.
Финальный результат можно открыть и показать, а не только описать словами.
Каждый сервис отвечает за свой кусок результата: хранение сырья, обработку, DWH-слои, оркестрацию и витрину. Так стек перестает быть списком названий и становится рабочей системой.
Собирает сервисы в одну локальную среду: код, хранилище, обработку, базу, оркестрацию и BI.

Код, README и история проекта.
RAW и промежуточные файлы.
Batch-трансформации и проверки.
DWH-слои и витрины данных.

DAG, логи, ретраи и расписание.

Проверка логики и результатов.
Витрина и метрики для бизнеса.
Каждый этап добавляет новый слой проекта: среду, сырье, очистку, ядро, витрины, проверки, оркестрацию и BI. Так маршрут читается как один рабочий пайплайн.
Поднять сервисы, проверить подключения, увидеть рабочую структуру проекта.
Загрузить исходные файлы и зафиксировать правила входного слоя.
Очистить типы, даты, дубли и строки, которые ломают дальнейшую обработку.
Собрать связи, ключи и устойчивую модель, на которую можно опираться.
Подготовить витрины под вопросы бизнеса, метрики и дальнейшую BI-историю.
Добавить проверки качества, reconciliation и понятные сигналы об ошибках.
Собрать DAG, зависимости, логику запуска и повторное выполнение.
Показать результат в витрине и уметь объяснить путь данных до цифры.
Маршрут рассчитан на спокойное прохождение по вечерам. Курс на Stepik и приватный GitHub-репозиторий остаются у вас навсегда, а моя поддержка в Telegram-группе работает до полного прохождения.
Docker, структура проекта, подключение к сервисам, первый smoke-check.
Прием сырья, правила хранения, контроль входных данных.
Типы, даты, дубли, пустые поля, ошибки формата и rejected rows.
Чтение, трансформации, запись, параметры запуска и логи выполнения.
Ключи, связи, факты, измерения и слой, который выдерживает повторный запуск.
Витрины под аналитику, понятные поля и проверяемый результат.
DAG, зависимости, retries, логи, запуск пайплайна и контроль падений.
Дашборд, объяснение логики, ответы на вопросы по проекту.
Смысл практикума в том, чтобы довести проект до состояния, которое можно открыть, запустить, показать и объяснить. Поэтому доступы и поддержка устроены вокруг прохождения.
Можно вернуться к урокам, перепройти сложный кусок, сверить шаги и восстановить контекст после паузы.
В репозитории хранится код проекта: структура, DAG, SQL, Spark jobs и инструкции по запуску.
Если пайплайн упал, проверка не сходится или непонятен лог, вопрос можно разобрать в группе.
Важны не только правильные ответы, но и повторный запуск, качество данных и понятный путь до BI.
Оптимально держать 6-8 часов в неделю, но доступы не исчезают, если график временно просел.
Это не курс для полного нуля. Здесь нормальная точка входа: базовый SQL, базовый Python и желание разбираться в логах, ошибках и связях между слоями.
Если база проседает, сначала закрываем SQL или Python. Если база есть, идем в практикум и собираем контур данных.
Официальные отзывы опубликованы на Stepik. Ниже также оставил обратную связь участников первых потоков.
Сквозной пример обработки данных от RAW до BI-дашбордов с использованием популярного DE-стека. Готовый каркас ETL для собственных проектов, широкий охват инструментов и очень много практики. Удобный чат по каждому разделу, где можно задавать вопросы и получать ответы.
В курсе много практики и минимум теории. После прохождения появилась полная картина работы с данными. Материалы подаются структурированно, четко и с постепенным ростом сложности. На вопросы Дмитрий отвечает оперативно.
Самое полезное можно разделить на две части: навык и инструментарий. По SQL стало понятнее, как работать со схемами, таблицами, индексами и партициями. Хорошо разобраны Airflow, Spark и S3.
До практикума я работала только с этапом, где данные уже загружены. Как они загружаются, преобразуются и собираются в полный цикл, было непонятно. Практикум помог собрать эту картину целиком.
Стартуем 10 августа. Доступ к курсу и приватному репозиторию остается навсегда, поддержка в Telegram действует до полного прохождения.
Да. Материалы и репозиторий не сгорают, а поддержка в Telegram сохраняется до полного прохождения.
Postgres, Airflow, четыре CSV-файла, слои RAW, STG, CORE и MARTS, проверки качества и HTML-отчет. Это облегченная версия для проверки локального запуска и формата работы.
Сначала закрыть базу отдельным маршрутом. Практикум опирается на рабочий SQL и базовый Python, чтобы основное время уходило на инженерный проект.
Нет. Нужны базовые SQL и Python, готовность поднять локальный стенд и разбирать ошибки по логам.