О чём вебинар
Практический вебинар о том, как Trino выполняет один SQL-запрос над Iceberg/S3, PostgreSQL/Pangolin и ClickHouse: разбираем план распределенного выполнения и показываем, когда федеративный запрос стоит оптимизировать, а когда лучше выполнять его по частям.
Trino часто воспринимают как простой способ дать пользователям один SQL поверх разных систем. Но как только запрос объединяет Iceberg, PostgreSQL и ClickHouse, производительность начинает определяться не только текстом SQL, а тем, где физически выполняются фильтры, агрегации и соединения, сколько данных уходит по сети и какие операции Trino вынужден выполнять сам.
На вебинаре разберем путь запроса от координатора до источников и на живом примере посмотрим план федеративного запроса через EXPLAIN ANALYZE. Найдем место, где запрос начинает терять время, и сравним несколько способов исправления: ранняя проверка условий, уменьшение объема данных до соединения, изменение стратегии выполнения, материализация в Iceberg, выполнение части вычислений непосредственно в источнике.
Отдельно покажем роль Iceberg/S3 в такой архитектуре и коротко сравним Trino с PostgreSQL/Greenplum, ClickHouse и Spark SQL. В финале покажем, какие темы продолжаются на курсе «Trino для инженеров данных»: развертывание, Iceberg с записью, коннекторы, глубокая оптимизация, BI, мониторинг.
Цели вебианар:
Показать, как Trino физически выполняет федеративный запрос над несколькими источниками данных
Научить видеть в EXPLAIN ANALYZE перемещение данных и основные причины потери производительности
Показать роль Apache Iceberg и S3 как lakehouse-слоя в архитектуре с Trino
Дать критерии выбора между федерацией, материализацией и выполнением запроса непосредственно в источнике
Показать границы применимости Trino в сравнении с PostgreSQL/Greenplum, ClickHouse, Spark SQL
Предварительная подготовка:
Уверенное владение SQL
Практический опыт хотя бы с одной реляционной или аналитической СУБД
Базовое понимание DWH/ETL/ELT
Предварительное знание Trino и Apache Iceberg не требуется
Содержание
Зачем нужен единый SQL-слой: Iceberg/S3, PostgreSQL/Pangolin и ClickHouse в одной платформе
Что происходит после SELECT
Iceberg в архитектуре Trino: табличный формат, REST Catalog, S3 и общий слой данных для разных движков
Живая демонстрация: запрос к Iceberg + PostgreSQL + ClickHouse и разбор EXPLAIN ANALYZE
Варианты исправления медленного запроса
Trino или другой движок: PostgreSQL/Greenplum, ClickHouse, Spark SQL для разных классов задач
Что меняется в проде: BI-нагрузка, управление группами ресурсов, память, мониторинг
Курс «Trino для инженеров данных»: что разбираем глубже и на практике
Другие разделы