Улучшаемые навыки
Advanced Pandas
NumPy
Векторизация
Оптимизация памяти
A/B тестирование
Продуктовые метрики
Когортный анализ
От Jupyter к Production
Git
Plotly
Качество кода (Clean Code)
Инструменты
Python
NumPy
Чему вы научитесь
01
Ускорять код и экономить память: применять векторизацию NumPy и движок pyarrow, сокращая время обработки данных с часов до минут и избегая ошибок «Out of Memory».
02
Считать продуктовые метрики: применять продвинутые объединения, GroupBy и оконные функции (Window Functions) для построения когортного анализа, расчета Retention Rate и LTV.
03
Оценивать бизнес-гипотезы (A/B тесты): использовать математическую статистику (scipy.stats) для применения Т-критерия и U-критерия Манна-Уитни, чтобы отличать случайные колебания от реального эффекта.
04
Обеспечивать достоверность: программно находить аномалии и выбросы в данных, защищая бизнес от принятия решений на основе мусорных метрик.
05
Автоматизировать работу: переносить логику из Jupyter Notebook в структурированные .py модули с логированием и использованием Git, создавая стабильные локальные пайплайны.
Как проходит обучение
Практика и постепенная сборка одного сквозного проекта. Каждый блок включает:
Краткую теорию и live‑coding
Задачи на отработку конкретных приёмов
Домашние задания
Обсуждение типичных ошибок и способов оптимизации
Программа курса
01
Инженерная культура аналитика
Ограничения Jupyter Notebook при автоматизации.
Структура проекта и Git для совместной работы.
Изоляция среды: venv, requirements.txt.
Линтеры: ruff.
Логирование (logging) и обработка исключений в аналитических скриптах.
02
Ускорение расчетов: NumPy и линейная алгебра
Как математическая база (векторы, матрицы) ложится на Python.
Оценка O-сложности: почему циклы for убивают производительность аналитики.
Векторизация вычислений и Broadcasting: как считать миллионы строк мгновенно.
Быстрое маскирование и фильтрация данных на уровне C-библиотек.
03
Промышленный Pandas: оптимизация памяти и логики
Анатомия DataFrame и оптимизация памяти: category, pyarrow.
Продвинутые манипуляции: MultiIndex, сложные объединения.
GroupBy и оконные функции: когортный анализ, Retention Rate, LTV, скользящие средние.
04
Статистика и проверка гипотез (A/B тестирование)
Базовая статистика для бизнеса: распределения, квантили, доверительные интервалы.
Программная детекция выбросов и обработка пропусков.
Практика A/B тестирования: реализация Т-теста и U-критерия Манна-Уитни на Python (scipy.stats) для оценки бизнес-экспериментов.
Интерактивная визуализация инсайтов с Plotly.
05
Работа со сложными источниками (Big Data ready)
Ограничения .csv и переход на колоночное хранение (.parquet).
Пакетная обработка (chunking): как обработать 10 ГБ файл на ноутбуке с 8 ГБ RAM.
Извлечение данных из PostgreSQL в DataFrame через SQLAlchemy
Составление промптов для генерации сложных цепочек преобразований в Pandas.
Использование LLM (RAG) для интерпретации результатов статистического анализа.
Автоматизированная генерация документации к таблицам и витринам (Data Dictionary).
Рефакторинг: декомпозиция линейного ноутбука на .py-модули
Построение модульного пайплайна: Сбор данных → Очистка → Метрики → Экспорт в Parquet
Защита проекта: Code Review экспертом (аудит сложности, времени выполнения, памяти)
08
Итого на курс 40 ак. ч.: теория — 12 ак. ч. (30%), практика — 28 ак. ч. (70%)
Для кого
Бизнес-аналитик
Дата-аналитик
Data Engineer
Разработчик
Предварительная подготовка
Уверенное владение базовым синтаксисом Python: циклы, функции, коллекции. Базовый опыт работы с библиотекой Pandas: чтение файлов, простая фильтрация. Понимание базовых концепций реляционных баз данных (SQL) будет плюсом. Рекомендуется прохождение курса «Прикладной Python для ИТ-специалистов + ИИ-инструменты» (PY-001) или эквивалентный практический опыт от 6 месяцев.