- Особенности:
- Apache Spark, Scala, PySpark, DataFrames, Structured Streaming, MLlib, GraphX, YARN, Kubernetes orchestration, Big Data pipelines
- Для кого:
- Разработчики на Java, Scala или Python с базовым опытом участия в разработке ПО, решающие задачи обработки больших данных и построения аналитических конвейеров
- Результат:
- Реализация конвейера обработки Big Data, развертывание Spark-задач в кластере Kubernetes, настройка потоковой аналитики данных
- Важно знать:
- Требуется владение SQL и опыт работы с командной строкой Linux и Docker для настройки сред исполнения
- Плюсы:
- Опыт оптимизации высоконагруженных потоковых вычислений через Structured Streaming и интеграция с оркестраторами нагрузки
- Что еще:
- Архитектурный подход к проектированию распределенных вычислений и управлению кластерными ресурсами
- Формат:
- Лекции онлайн, видеоуроки в записи.
- Занятий:
- 2 занятия по 2 ак.часа в неделю
- Объем практики:
- 70%