проектировать и развивать RT/NRT-поставки данных для разных сценариев работы продуктовых команд;
тщательно продумывать, как будут взаимодействовать оперативный и batch-контуры, и подбирать архитектуру, которая обеспечит нужную скорость, полноту, стоимость и надёжность данных;
помогать системным аналитикам и продуктовым командам проектировать RT-данные;
подбирать источники и способы обработки, определять модель событий, контракты, требования к свежести и качеству данных;
прорабатывать правила работы с запаздывающими событиями и предварительными результатами;
искать новые способы работы с RT-данными, разрабатывать универсальные подходы;
помогать внутренним заказчикам разбираться, какие задачи можно решить с помощью RT-данных;
вести инженерные задачи: исследование процессов и источников данных, запуск решений в промышленную эксплуатацию, контролирование их работы и безопасное развитие DWH;
расширять возможности AI-агентов в автономном DWH: предоставлять им качественный контекст и инструменты, устанавливать ограничения и проверки, оценивать результаты работы и превращать сложные случаи в новые сценарии автоматизации;
работать с нетиповыми инцидентами — выявлять их системные причины и на этой основе создавать новые проверки, инструменты и возможности для агентов.
Требования
проектировали и поддерживали промышленные RT/NRT-пайплайны, понимаете, чем их разработка и эксплуатация отличаются от batch-обработки;
занимались разработкой в крупном DWH или распределенной платформе, понимаете, как безопасно менять процессы с большим графом зависимостей;
умеете проектировать надёжную обработку событийных данных с учётом задержек, повторной обработки и изменений источников;
уверенно владеете Python и SQL, понимаете принципы моделирования данных, качества, наблюдаемости и надёжной эксплуатации;
умеете превращать не до конца сформулированную бизнес-задачу в модель данных и техническое решение, сравнивать архитектурные варианты, объяснять компромиссы и договариваться с владельцами источников;
уже используете Artificial Intelligence-агентов в инженерной работе и хотите развивать подход, в котором человек управляет целями, качеством и архитектурой, а значительную часть реализации и поддержки выполняют агенты;
готовы брать ответственность за результат поставки данных, а не только за написанный код.
Условия
опытный инженер данных;
самостоятельный выбор задач, в которых Real Time/Near Real Time-данные будут действительно полезны;
проектирование решений;
запуск решений в промышленную эксплуатацию;
развитие решений вместе с продуктовыми командами;
работа со стеком технологий: Python, SQL и YQL, внутренний Code Driven фреймворк DMP Suite, YT, Greenplum и ClickHouse, Apache Flink / Flink Flow и LogBroker для потоковой обработки, встроенные инструменты Data Quality, мониторинга и управления Extract, Transform, Load-процессами;
глубокий практический опыт работы с Apache Flink будет плюсом;
практика построения lambda- или kappa-архитектуры и объединение оперативного и batch-контуров будет плюсом;
запуск нового платформенного направления или развитие внутренних data-продуктов будет плюсом;
практика проектирования data contracts и интеграция нескольких продуктовых систем будет плюсом;
разработка инструментов, контекста, проверок или evaluation-процессов для инженерных Artificial Intelligence-агентов будет плюсом.