Обзор большого собеседования с ITOne

IT и разработка 08.05.2026 · 👁 3 420 просмотров
Обзор большого собеседования с IT_One У моего менти было интересное собеседование 😢 Длительность 3 часа 💀 "По опыту косвенные вопросы , по типу на вопросах иногда просили уточнить как это было устроено у вас на работе" Кандидат ответил на все вопросы и очень хорошо. Пришел отказ без нормальной обратной связи. В общем, та еще клоунада. IT_One в своем репертуаре )) Но мы получили хороший список вопросов для самопроверки. Всем будет полезно. Основные вопросы: 1) Чем отличаются DWH и Data Lake? 2) Какие существуют форматы хранения данных? 3) Какие преимущества у колоночных форматов, например Parquet? 4) Что такое OLTP и OLAP? 5) Какие задачи решают OLTP и OLAP системы? 6) Что такое snapshot в контексте DWH? 7) Что такое staging слой в DWH? 8)Какова роль core слоя в DWH? 9)Что такое marts в DWH? 10)Объясните понятие surrogate key. 11)Чем отличается surrogate key от natural key? 12)Что такое Kimball методология? 13)Что такое Inmon методология? 14)В чем разница между star и snowflake схемами? 15)Как выбрать последние 1000 записей по времени с помощью SQL? 16)Что такое running balance и как его реализовать? 17)Чем оконные функции отличаются от агрегатных? 18)Как реализовать фильтрацию по конкретной дате в SQL? 19)Какие типы JOIN существуют? 20)Как оптимизировать JOIN в больших таблицах? 21)Что такое партиционирование в базах данных? 22)Чем полезна архитектура MPP? 23)Как справляться с проблемой data skew? 24)Какие методы обработки невалидных данных вы знаете? 25)Что такое quarantine для данных? 26)Как организовать мониторинг качества данных? 27)Чем отличается commit от push в git? 28)Что такое ветвление (branching) в git? 29)Как устроен CI/CD pipeline? 30)Как хранить secrets в CI/CD системах? 31)Что такое Spark? 32)Как устроена архитектура Spark? 33)Что такое RDD и DataFrame в Spark? 34)Как писать Spark-приложения на PySpark? 35)Как реализовать сложную агрегацию в Spark? 36)Что такое HDFS и как с ним работать? 37)Как автоматизировать запуск Spark job через Airflow? 38)Как работает Kafka? 39)Что такое Kafka Connect? 40)Как реализовать потоковую обработку на базе Kafka и ClickHouse? 41)Как устроен Data Pipeline с Kafka → Kafka Connect → Materialized Views → ClickHouse? 42)Что такое dbt и для чего он нужен? 43)Как dbt помогает с lineage данных? 44)Какие преимущества у инкрементальной загрузки данных? 45)Как проектировать ключи дистрибуции в Greenplum? 46)Какие средства мониторинга и алертинга вы использовали? 47)Что такое Iceberg и Trino? 48)Как настроить multi-cluster обработку в Spark? 49)Какие есть best practices для ETL пайплайнов? 50)Как проводить code review для ETL и аналитического кода? Задачу тоже прикрепляю 🫡 Как вам собесик 😁 ? Ответили б на все вопросы? it пингвин | data engineer 🐧 #собеседование #менти
Откликнуться в Telegram →

⚠️ Никогда не платите «за оформление» или «гарантию трудоустройства» — это признак мошенников. Работа ТРУ не несёт ответственности за содержание вакансии.

🇮🇱 Не нашли подходящую зарплату? В Израиле платят от $3000 Без языка и опыта · жильё и легализация под ключ · официально Смотреть вакансии →