Описание вакансии
Инженер по разработке данных (специализация на реальном времени)
Обзор позиции:
- Компания создала хорошо развитое хранилище данных и систему данных в реальном времени с возможностями сбора, вычисления, хранения и обслуживания данных. С ростом масштабов бизнеса и увеличением сценариев применения в реальном времени мы ищем двух инженеров по разработке данных среднего и старшего уровня, которые возьмут на себя ответственность за поставку требований к данным в реальном времени, оптимизацию задач и управление инженерными процессами.
- Эта роль в основном сосредоточена на разработке данных в реальном времени, но также включает вклад в построение оффлайн-хранилища данных. Вы будете решать критические проблемы в конвейерах данных реального времени, такие как задержка данных, расширение состояния, потребление ресурсов, качество данных и согласованность, способствуя повышению стабильности, эффективности и стандартизации системы данных в реальном времени.
Ключевые обязанности
- Анализ, проектирование и разработка решений для данных в реальном времени с использованием технологий, таких как Flink и Kafka, для поддержки аналитики, мониторинга, метрик и принятия бизнес-решений в реальном времени.
- Участие в построении хранилища данных в реальном времени и проектировании моделей, обеспечивая соответствие слоев данных, определений метрик, моделирования измерений и сервисов данных бизнес-потребностям.
- Постоянная оптимизация существующих задач в реальном времени для решения проблем, таких как задержка данных, обратное давление, аномалии Checkpoint, расширение состояния, неэффективность ресурсов и несогласованность данных, повышая стабильность задач и эффективность вычислений.
- Участие в инициативах по управлению данными и качеству инженерных процессов, включая картирование зависимостей задач, управление метаданными, мониторинг качества данных, механизмы оповещения, стандарты разработки и структуры устранения неполадок.
- Сотрудничество с командами выше и ниже по потоку для поддержания стабильности, точности и своевременности конвейеров данных, а также помощь в ежедневном обслуживании платформ больших данных и вычислительных движков.
- Документирование и обмен лучшими практиками разработки в реальном времени и техническими инсайтами через проверку кода, технические обсуждения и оценку решений для повышения возможностей команды в разработке в реальном времени.
Требования к кандидату
- Степень бакалавра или выше в области компьютерных наук, программной инженерии, информационных технологий или смежной области, с опытом работы в разработке данных или инженерии больших данных от 5 лет (возможны исключения для высококвалифицированных кандидатов).
- Подтвержденный опыт работы в проектах хранилищ данных, с экспертизой в архитектуре хранилищ данных в реальном времени, слоях данных и проектировании моделей для преобразования бизнес-требований в технические решения.
- Владение Flink, включая практический опыт работы с Flink SQL и DataStream API, и глубокое понимание State, Checkpoint, Watermark, оконных функций, обратного давления и механизмов отказоустойчивости.
- Опыт разработки и оптимизации задач в реальном времени, с возможностью самостоятельного устранения проблем, таких как задержка, высокое потребление ресурсов, аномалии состояния, перекос данных и согласованность.
- Знание Kafka и конвейеров данных в реальном времени, охватывающих полный жизненный цикл сбора, передачи, вычисления, хранения и обслуживания данных.
- Знание Hadoop, Hive, Spark и других технологий больших данных, с некоторым опытом в оффлайн-разработке данных.
- Сильные навыки SQL для сложной обработки данных и настройки производительности, а также владение хотя бы одним языком программирования (Python, Java или Scala).
- Опыт работы с базами данных или системами хранения, такими как MySQL, PostgreSQL или Elasticsearch.
- Отличное бизнес-чутье, коммуникативные навыки и письменное выражение, с сильным чувством ответственности и инициативой для решения проблем и выполнения проектов.
Предпочтительные квалификации
- Опыт разработки крупномасштабных задач Flink, настройки производительности или управления кластерами.
- Опыт оптимизации хранилищ данных в реальном времени, управления конвейерами или технических обновлений.
- Знание технологий реального времени OLAP, таких как Hologres, ClickHouse или Doris.
- Опыт работы со сложными бизнес-сценариями, такими как метрики в реальном времени, мониторинг, управление рисками или системы рекомендаций.
Наш идеальный кандидат
Мы ищем человека, который не только предоставляет решения для данных, но и углубляется в механизмы вычислений в реальном времени, уделяя приоритетное внимание стабильности конвейеров, производительности и качеству инженерных процессов. При решении сложных проблем вы должны уметь диагностировать корневые причины с нескольких точек зрения — данные, код, конфигурации задач и операционные механизмы — и формализовать решения в переиспользуемые стандарты или инструменты.
Преимущества
Подробности будут обсуждаться в процессе собеседования.