Data engineer: кто это, чем занимается и как стать инженером данных

Инженер данных за двумя мониторами со схемой конвейера данных Базы данных

Data engineer, или инженер данных, это специалист, который строит конвейеры: по ним данные компании попадают из рабочих систем в хранилище. Он же следит, чтобы они приходили вовремя, полностью и без ошибок, а аналитики и data scientist потом работают с таблицами и витринами, которые он подготовил.

Что делает ETL и ELT-процессы, хранилища и озёра данных, витрины, оркестрация, контроль качества
Главные инструменты SQL и Python почти везде, дальше Airflow, ClickHouse, Spark, Hadoop, Kafka
Вакансии 193 с названием data engineer или инженер данных на 8 октября 2026 года, без опыта работы 8
Зарплата Медиана 257 083 ₽, у джуна 136 666 ₽ по калькулятору Хабр Карьеры на ту же дату
С чего приходят в профессию Аналитика данных, бэкенд, ETL-разработка, администрирование баз

Кто такой data engineer

В названиях вакансий профессию пишут по-разному: data engineer, дата-инженер, инженер данных, инженер по данным; в описаниях вакансий встречается и сокращение DE. Саму область называют data engineering, по-русски инженерия данных. Рядом стоит big data: часть вакансий так и называется, «Big Data Engineer».

В банке, маркетплейсе или на заводе информация рождается в десятках систем: в приложении, CRM, учётной программе, на датчиках. Каждая хранит её в своём формате. Инженер данных проектирует, как собрать сведения из разных источников в одно место, очистить, привести к общему виду и выдать тем, кто будет их анализировать.

Хорошо видно это по вакансии нефтяной компании «Инженер данных промысла». В вакансии ищут инженера, «который соберёт в одну базу добычу, закачку и энергопотребление с приборов и сделает так, чтобы ключевые показатели считались без участия человека». В обязанностях сбор показаний со SCADA и счётчиков, выгрузка журналов станций управления до их перезаписи, поиск расхождений между отчётами и дашборды для руководства.

Чем занимается инженер данных

У младшего инженера данных в одной компании задачи, например, такие: «разработка и поддержка ETL-процессов для сбора, очистки и фильтрации данных», «интеграция данных из различных источников», «обеспечение и контроль качества данных».

ETL и ELT

Основная часть работы называется ETL: extract, transform, load, то есть извлечь, преобразовать, загрузить. При ETL данные преобразуют сразу после извлечения из источника и кладут в хранилище уже очищенными. При ELT порядок другой: сырые данные сначала загружают в хранилище или озеро, а преобразуют по мере необходимости. ETL или ELT упоминают 150 вакансий из 193.

Хранилища, озёра и витрины

Хранилище данных (DWH, data warehouse) собирает сведения из разных систем в единый вид, хранит их историю и нужно для анализа и принятия решений. Озеро данных (Data Lake) принимает «сырые» данные любого вида: структурированные таблицы, полуструктурированные и неструктурированные файлы. Витрины строят для конкретных потребителей. В одном банке команда дата-инженеров делает их «на базе множества внутренних и внешних источников из автоматизированных систем банка для аналитиков и DS». DWH упоминают 112 вакансий из 193, витрины 107, озеро 43.

Читайте также:  Курсы SQL: платные и бесплатные, для начинающих и для аналитика

Схема конвейера данных от источников к хранилищу и витринам на доске

Оркестрация и потоки в реальном времени

Загрузки идут по расписанию и зависят друг от друга: отчёт нельзя пересчитать, пока не пришли вчерашние продажи. Порядок задаёт оркестратор, чаще всего Apache Airflow, он нужен в 125 вакансиях. Задачи в нём описывают на Python в виде графа, DAG, а Airflow запускает их по расписанию и следит за выполнением. Он рассчитан на пакетные загрузки с началом и концом. Если события нужно обрабатывать в реальном времени, используют Apache Kafka: она принимает потоки событий, надёжно их хранит и даёт обработать в момент поступления или позже. Kafka есть в 73 объявлениях.

Качество и инфраструктура

Инженер данных ставит проверки на загрузку: схема таблицы, полнота, дубликаты, расхождения между источниками. В одной вакансии задача звучит так: «внедрять автоматизированные проверки схем, целостности и полноты данных на этапах загрузки и обработки». Качество данных или data quality называют 68 вакансий. Ещё одна часть работы связана с инфраструктурой вокруг пайплайнов: в той же вакансии это мониторинг, алертинг, CI/CD, резервное копирование, управление доступами и безопасность данных.

Чем data engineer отличается от аналитика данных и data scientist

Data engineer Аналитик данных Data scientist
Главный вопрос Как доставить данные надёжно и быстро Что данные говорят о бизнесе Что будет дальше, какой прогноз даст модель
Результат работы Пайплайны, DWH, витрины Отчёты, дашборды, выводы Модели машинного обучения
Медиана middle, ₽ 238 249 185 833 229 166

Медианы по калькулятору Хабр Карьеры на 8 октября 2026 года.

Аналитик данных ищет ответы на вопросы бизнеса, подробно мы разбирали эту профессию в статье про аналитика данных. Data scientist строит модели, это направление называют data science. Инженер готовит данные, с которыми оба потом работают. С моделями он тоже сталкивается: в одной нефтяной компании у него в задачах стоит «оптимизация MVP-решения команд data scientist для переноса их в продуктив».

С администратором баз данных граница другая. DBA отвечает за саму СУБД: резервные копии, репликацию, доступы. Инженер данных строит процессы, которые перекладывают информацию между системами.

Какие навыки нужны data engineer

Навыки для профессии мы считали по требованиям работодателей: упоминания технологий в 193 вакансиях на 8 октября 2026 года. Одна вакансия обычно просит несколько инструментов, поэтому сумма больше 193.

Инструмент Объявлений из 193
SQL 183
Python 167
Airflow 125
ClickHouse 100
Spark 97
PostgreSQL 86
Git 80
Hadoop (HDFS, Hive) 75
Kafka 73
Greenplum или Arenadata 61
Docker или Kubernetes 57
Scala 37
Java 33
dbt 32

SQL и Python нужны почти всем. В требованиях к младшему инженеру данных стоит ещё и «умение работать с большими объёмами данных». Apache Spark это движок для обработки больших объёмов данных на одной машине или на кластере, писать для него можно на Python, SQL, Scala и Java. Scala нужна в 37 вакансиях, и в 36 из них рядом с ней стоят Spark или Hadoop.

Облачные платформы AWS, Google Cloud и Azure встречаются только в 5 вакансиях из 193, Yandex Cloud в 6. Гораздо чаще нужны ClickHouse, Hadoop и Greenplum, поэтому учить западные облака ради первой работы мы бы не стали. Английский упоминают 19 вакансий, высшее образование 38, иногда со словом «желательно» или наравне со средним специальным.

Читайте также:  Администратор баз данных: кто это, чем занимается и как им стать

Работать приходится и с людьми: в Сбере в обязанностях стоит «общение с заказчиком, уточнение бизнес-требований». На Московской бирже ждут «готовность делиться знаниями, проводить код-ревью, учить джуниоров».

Дата-инженер разбирает с аналитиком требования к витрине данных

Где работает инженер данных и сколько вакансий

Чтобы оценить спрос на рынке труда, мы искали на hh.ru 8 октября 2026 года по названиям data engineer, дата-инженер, инженер данных и инженер по данным. Нашлось 218 вакансий, но в выдачу попали и data scientist, ML-инженеры и даже геолог на буровой: поиск находит названия, где слова стоят порознь. После того как мы открыли каждую, осталось 193 настоящих места для инженера данных: 137 в Москве, 19 в Санкт-Петербурге, остальные в Нижнем Новгороде, Екатеринбурге, Казани и других городах. Среди работодателей банки, биржа, маркетплейсы, онлайн-кинотеатр, нефтяные компании, госучреждения.

Сколько зарабатывает data engineer

По калькулятору зарплат Хабр Карьеры на 8 октября 2026 года медиана инженера по данным 257 083 ₽ в месяц по 379 анкетам. По всем IT-специалистам там же 182 833 ₽.

Грейд Медиана, ₽ Анкет
Стажёр 88 641 14
Junior 136 666 59
Middle 238 249 186
Senior 361 666 79
Lead 420 000 41

На hh.ru зарплату указали 24 вакансии из 193. Медиану по ним мы не считаем: на грейд приходится 4-7 объявлений, одни пишут только «от», другие только «до», одни на руки, другие до вычета. Стажёрам и ученикам без опыта предлагают от 20 000 до 110 000 ₽ до вычета, ещё в одной вакансии без опыта до 80 000 ₽ на руки. При опыте работы 1-3 года встречаются 120 000 ₽ до вычета в Воронеже, 200 000 ₽ на руки и «до 480 000 ₽» до вычета в крупном банке. Сравнить профессию data engineer с другими направлениями можно по обзору, сколько зарабатывают программисты.

Плюсы и минусы профессии

Что хорошо:
— зарплата у джуна выше, чем у джуна аналитика данных: 136 666 ₽ против 105 833 ₽ по Хабр Карьере;
— можно работать удалённо: такой формат указан в 75 вакансиях из 193;
— работодатели из разных отраслей: банки, биржа, маркетплейсы, нефтяные компании.

Что тяжело:
— вход почти закрыт для новичков, 118 вакансий из 193 просят опыт работы 3-6 лет;
— стек большой и разный от компании к компании, к SQL и Python добавляются Airflow, Spark, Kafka и своё хранилище;
— кроме разработки, на инженере данных поддержка: в одном банке он должен «участвовать в диагностике и устранении инцидентов, проводить пост-инцидентный анализ».

Дата-инженер вечером дома разбирает упавшую загрузку данных

Как стать дата-инженером и где учиться

Data engineer редко бывает первой работой в IT. Без опыта было 8 вакансий из 193, и пять из них одна и та же программа: компания приглашает «на обучение Дата инженер с последующим трудоустройством», месяц онлайн-интенсива и 3-4 месяца стажировки. Шестая вакансия на срочный договор с английским уровня B2, седьмая предлагает стажёру 20 000-40 000 ₽. Восьмая, тоже «без опыта», в тексте всё равно просит опыт с PostgreSQL, ETL-процессами и Python.

Читайте также:  Курсы SQL: платные и бесплатные, для начинающих и для аналитика

Чаще в профессию переходят с соседней работы, и в вакансиях это прямо засчитывают. В трёх вакансиях одного банка просят «опыт работы 1 год + в качестве Data Engineer / Data Analyst / ETL Developer». В другом банке подходит опыт в роли «Data Engineer/Backend Developer». Реальные пути выглядят так:

  1. Аналитик данных. Уже знает SQL и бизнес-данные, остаётся освоить программирование пайплайнов и Airflow.
  2. Бэкенд-разработчик на Python. Умеет писать код для продакшена, добирает архитектуру хранения данных и продвинутый SQL.
  3. ETL-разработчик или администратор баз данных. Знает СУБД изнутри, добирает оркестрацию и Spark.

Учить мы бы советовали в том порядке, в каком инструменты встречаются в вакансиях. Сначала SQL до оконных функций и чтения плана запроса, с этим помогут курсы SQL. Потом Python для обработки данных, Git и Linux. Дальше Airflow и одна СУБД для аналитики, например ClickHouse или PostgreSQL: их называют чаще других. Даже от младшего инженера ждут «знание основ ETL-процессов». Spark и Kafka на третьем месте. Если английский позволяет, есть бесплатный курс Data Engineering Zoomcamp, все материалы на английском. По описанию курса это 9 недель: Docker, оркестрация, dbt, Spark и Kafka, начать можно в любой момент, а сертификат дают только за финальный проект в потоке. Аналитическая база там BigQuery от Google, её упоминают 3 вакансии из 193.

Начинающий дата-инженер собирает учебный пайплайн дома за ноутбуком

Сделайте пет-проект: возьмите открытые данные, загрузите их по расписанию через Airflow в PostgreSQL или ClickHouse, добавьте проверку на дубликаты и пропуски, постройте витрину и простой дашборд. Нефтяная компания из примера выше просит прислать с резюме «краткое описание одного реализованного проекта: что было, что сделали, какой результат в цифрах». Как упаковать такой проект, мы разбирали в статье про портфолио программиста.

Часто задаваемые вопросы

Можно ли стать data engineer без опыта?

Сразу почти нельзя. На 8 октября 2026 года на hh.ru было 8 вакансий без опыта из 193, пять из них программа обучения одной компании. Реальнее сначала поработать аналитиком данных, бэкенд-разработчиком или ETL-разработчиком и перейти в профессию инженера данных внутри компании.

Какой язык программирования нужен инженеру данных?

Python, он нужен в 167 вакансиях из 193. Вместе с ним нужен SQL (183). Scala и Java встречаются реже, в 37 и 33 объявлениях; Scala почти всегда идёт вместе со Spark или Hadoop.

Нужна ли математика data engineer?

Глубокая математика нужна data scientist для моделей машинного обучения. Инженеру данных важнее SQL, Python, устройство баз и хранилищ. Математику упоминают 10 вакансий из 193, и в 9 из них это направление высшего образования: «техническое/математическое» и подобное.

Можно ли работать дата-инженером удалённо?

Да, удалённый формат указан в 75 объявлениях из 193. В остальных офис или гибрид, у пяти формат не указан.

Сколько времени нужно, чтобы стать data engineer?

Зависит от стартовой точки. Программа обучения одной компании для новичков без опыта занимает месяц онлайн-интенсива и 3-4 месяца стажировки. Аналитику данных, который уже пишет SQL каждый день, нужно добрать Python, Airflow и одну СУБД для аналитики. Новичку без опыта работы в IT сначала придётся выйти на первую работу в соседней профессии: 118 вакансий из 193 ждут опыт 3-6 лет.

Оцените статью
Блог о программировании
Добавить комментарий