Описание вакансии
Должность: Старший инженер облачной инфраструктуры и SRE
Как старший инженер облачной инфраструктуры и SRE, вы будете играть ключевую роль в обеспечении стабильности, безопасности и эффективности наших основных торговых систем и связанной инфраструктуры. Эта должность требует сочетания технических знаний, навыков решения проблем и способности работать в команде для поддержания высокой доступности и производительности нашей производственной среды.
Ключевые обязанности
- Обеспечение круглосуточной стабильности основных торговых систем, включая цепочки транзакций, сервисы рыночных данных и связанную инфраструктуру. Участие в аварийном реагировании на критические инциденты, включая идентификацию проблем, управление рисками, восстановление сервисов и посмертный анализ для гарантии непрерывности торговли и безопасности активов пользователей.
- Проектирование, внедрение и постоянная оптимизация производственной инфраструктуры AWS и EKS/Kubernetes, включая облачную архитектуру, сетевые решения, высокую доступность, планирование мощностей и аварийное восстановление. Управление обновлениями кластеров Kubernetes, жизненным циклом узлов, планированием, управлением ресурсами, Ingress/балансировкой нагрузки, DNS, хранением данных и автоматическим масштабированием.
- Разработка и улучшение систем наблюдаемости и стабильности производства (Metrics, Logs, Tracing, Alerting, SLI/SLO, Incident Response, Postmortem) для повышения эффективности обнаружения, диагностики и восстановления проблем. Сотрудничество с командами разработки для устранения узких мест системы, единых точек отказа и долгосрочных проблем архитектурной стабильности.
- Продвижение практик Infrastructure as Code (IaC), CI/CD и автоматизации (Terraform/Terragrunt, GitHub Actions, Ansible) для стандартизации и автоматизации поставки инфраструктуры и приложений. Улучшение механизмов проверки изменений, развертывания, верификации и отката для минимизации производственных рисков.
- Управление производственной эксплуатацией основных сервисов данных и промежуточного ПО, включая MySQL, Redis и Kafka, обеспечивая высокую доступность, мониторинг, планирование мощностей, резервное копирование/восстановление, оптимизацию производительности и устранение инцидентов.
- Реализация управления безопасностью для AWS, Kubernetes и производственных сред, включая контроль доступа с минимальными привилегиями (IAM/RBAC), сетевую изоляцию, безопасность контейнеров/образов, управление секретами (Secrets/KMS), управление уязвимостями и аудиты безопасности. Координация с соответствующими командами для реагирования на инциденты безопасности.
Требования к кандидату
- Степень бакалавра или выше в области компьютерных наук или смежных дисциплин и 5+ лет опыта работы в DevOps, SRE или облачной инфраструктуре. Подтвержденный опыт эксплуатации крупномасштабных производственных сред, управления изменениями и устранения сложных инцидентов. Сильные навыки проектирования и внедрения инфраструктуры с отличным осознанием рисков и способностью к межкомандному сотрудничеству.
- Прочная база в Linux, сетевых технологиях и контейнерах с практическим опытом работы с Kubernetes/EKS в производственной среде. Способность самостоятельно выполнять настройку кластеров, обновления, оптимизацию и устранение неполадок на уровнях Pod, Node, сети и кластера. Знание сред Java/Go и базовых методов устранения неполадок.
- Практический опыт работы с производственной средой AWS и основными сервисами (IAM, VPC, EC2, EKS, ALB/NLB, Route 53, S3, CloudWatch). Понимание принципов multi-AZ, высокой доступности, сетевой изоляции, минимальных привилегий, автоматического масштабирования, планирования мощностей и управления затратами. Способность проектировать инфраструктуру, оценивать риски и устранять инциденты.
- Сильные навыки в IaC, CI/CD и автоматизации с опытом работы с Terraform/Terragrunt, GitHub Actions, Ansible и т.д. Владение скриптовыми языками (Bash/Python) для повышения надежности поставки инфраструктуры и приложений.
- Опыт управления наблюдаемостью и стабильностью производства с использованием технологий Prometheus, Grafana, ELK/Loki, OpenTelemetry. Понимание Metrics, Logs, Tracing, SLI/SLO, управления оповещениями, планирования мощностей и механизмов аварийного восстановления.
- Знание эксплуатации и практик безопасности MySQL, Redis, Kafka (AWS IAM, Kubernetes RBAC, сетевая/контейнерная безопасность, Secrets/KMS, управление уязвимостями, аудиты безопасности). Способность выявлять и устранять риски безопасности в производственной среде.
- Предпочтителен опыт работы в индустрии Web3/Crypto с пониманием основ блокчейна и вопросов безопасности торговли цифровыми активами.
Предпочтительные квалификации
- Опыт работы на биржах цифровых активов, в сфере ценных бумаг, финансовой торговли или платежных систем с требованиями высокой доступности.
- Практический опыт работы с крупномасштабными/высоконагруженными средами Kubernetes/EKS, управлением мультиаккаунтами AWS или кросс-региональным аварийным восстановлением.
- Продвинутые знания в области cloud-native, облачной безопасности или оптимизации затрат (Karpenter, Argo CD/Flux, OpenTelemetry, eBPF, FinOps).
Преимущества
- Высококонкурентный компенсационный пакет
- Спонсорство рабочей визы в Сингапур
- Плоская организационная структура с разнообразной и инклюзивной корпоративной культурой
- Щедрая политика отпусков/больничных с отличным балансом работы и личной жизни
Подать заявку напрямую: https://davionlabs.bamboohr.com/careers/75?source=aWQ9MzM%3D