Улучшаемые навыки
Advanced Pandas
NumPy
Векторизация
Оптимизация памяти
A/B тестирование
Продуктовые метрики
Когортный анализ
От Jupyter к Production
Git
Plotly
Качество кода (Clean Code)
Инструменты
Python
NumPy
Чему вы научитесь
01
Ускорять код и экономить память: применять векторизацию NumPy и движок pyarrow, сокращая время обработки данных с часов до минут и избегая ошибок «Out of Memory».
02
Считать продуктовые метрики: применять продвинутые объединения, GroupBy и оконные функции (Window Functions) для построения когортного анализа, расчета Retention Rate и LTV.
03
Оценивать бизнес-гипотезы (A/B тесты): использовать математическую статистику (scipy.stats) для применения Т-критерия и U-критерия Манна-Уитни, чтобы отличать случайные колебания от реального эффекта.
04
Обеспечивать достоверность: программно находить аномалии и выбросы в данных, защищая бизнес от принятия решений на основе мусорных метрик.
05
Автоматизировать работу: переносить логику из Jupyter Notebook в структурированные .py модули с логированием и использованием Git, создавая стабильные локальные пайплайны.
Как проходит обучение
Обучение построено вокруг практики и постепенной сборки одного проекта.
Каждый блок включает:
краткую теорию и live‑coding,
задачи на отработку конкретных приёмов,
домашние задания,
обсуждение типичных ошибок и способов оптимизации.
Программа курса
01
Инженерная культура аналитика
Инженерная культура аналитика | Ограничения Jupyter Notebook при автоматизации.
Структура проекта и Git для совместной работы.
Изоляция среды (venv, requirements.txt) и линтеры (ruff).
Безопасное выполнение: логирование (logging) и обработка исключений в аналитических скриптах
02
Ускорение расчетов: NumPy и линейная алгебра
Как математическая база (векторы, матрицы) ложится на Python. Сравнение производительности: векторизация vs Python-циклы (Trade-off скорости и памяти).
Векторизация вычислений и Broadcasting: как считать миллионы строк мгновенно без перерасхода RAM..
Быстрое маскирование и фильтрация данных на уровне C-библиотек.
03
Промышленный Pandas: оптимизация памяти и логики
Анатомия DataFrame и оптимизация памяти (category, pyarrow).
Глубокая очистка данных: типизация, стратегия обработки пропусков и дубликатов.
Анализ временных рядов: работа с datetime, функции resample, rolling и expanding.
Продвинутые манипуляции: MultiIndex, сложные объединения.
Применение GroupBy и оконных функций для расчета продуктовых метрик: когортный анализ, Retention Rate, LTV и скользящие средние.
04
Статистика и проверка гипотез (A/B тестирование)
Базовая статистика для бизнеса: распределения, квантили, доверительные интервалы.
Методология A/B: постановка гипотез, выбор критерия, интерпретация p-value и доверительных интервалов. • Ошибки I и II рода, мощность теста и проблема множественных проверок.
Практика A/B тестирования: реализация Т-теста и U-критерия Манна-Уитни на Python (scipy.stats) для оценки бизнес-экспериментов.
Интерактивная визуализация инсайтов с Plotly.
05
Работа с данными вне оперативной памяти (Out-of-memory)
Ограничения формата .csv. Переход на колоночное хранение для скорости и сжатия (.parquet).
Пакетная обработка данных (chunking): как обработать 10 ГБ файл на ноутбуке с 8 ГБ RAM.
Извлечение данных напрямую из реляционных БД (PostgreSQL) в DataFrame через SQLAlchemy.
Составление промптов для генерации сложных цепочек преобразований в Pandas.
LLM как «второй пилот» аналитика: рефакторинг кода, объяснение ошибок и генерация unit-тестов.
Автоматизированная генерация документации к таблицам и витринам (Data Dictionary) с верификацией результата.
Создание production-ready проекта: переход от Jupyter-ноутбука к модульной структуре (.py).
Настройка окружения, использование Git и внедрение логирования для отладки пайплайна.
Автоматизация контроля качества: написание тестов для ключевых функций через pytest.
Построение модульного пайплайна: Сбор данных, Очистка, Вычисление метрик, Экспорт в Parquet.
Защита проекта через Code Review (аудит чистоты кода, стабильности и оптимизации ресурсов).
08
Итого на курс 40 ак. ч.: теория — 12 ак. ч. (30%), практика — 28 ак. ч. (70%)
Видео
Для кого
Бизнес-аналитик
Дата-аналитик
Data Engineer
Разработчик
Предварительная подготовка
Уверенное владение базовым синтаксисом Python (циклы, функции, коллекции).• Базовый опыт работы с библиотекой Pandas (чтение файлов, простая фильтрация). Понимание базовых концепций реляционных баз данных (SQL) будет плюсом. Рекомендуется прохождение курса PY-001 или эквивалентный практический опыт от 6 месяцев.