Описание вакансии
Ключевые обязанности
- Обеспечение круглосуточной стабильности основных торговых систем, включая цепочки транзакций, сервисы рыночных данных и связанную инфраструктуру. Участие в реагировании на инциденты, устранении неполадок и постмортем-анализе для гарантии непрерывности сервисов и безопасности активов.
- Проектирование, создание и оптимизация производственной инфраструктуры AWS и EKS/Kubernetes, включая облачную архитектуру, сетевые решения, высокую доступность, планирование ресурсов и аварийное восстановление. Управление кластерами Kubernetes: обновления, жизненный цикл узлов, планирование, управление ресурсами, Ingress/LB, DNS, хранилища и автомасштабирование.
- Разработка и улучшение систем наблюдаемости и стабильности (Metrics, Logs, Tracing, Alerting, SLI/SLO, Incident Response, Postmortem) для ускорения обнаружения, диагностики и устранения проблем. Взаимодействие с командами разработки для устранения узких мест и архитектурных рисков.
- Продвижение принципов Infrastructure as Code (IaC), CI/CD и автоматизации (Terraform/Terragrunt, GitHub Actions, Ansible) для стандартизации и автоматизации развертывания инфраструктуры и приложений. Улучшение процессов управления изменениями, выпусками, валидации и отката.
- Управление эксплуатацией ключевых сервисов данных и middleware (MySQL, Redis, Kafka), включая высокую доступность, мониторинг, планирование ресурсов, резервное копирование/восстановление, настройку производительности и устранение неполадок.
- Обеспечение безопасности AWS и Kubernetes: IAM/RBAC, сетевая изоляция, безопасность контейнеров/образов, управление секретами (Secrets/KMS), управление уязвимостями и аудиты безопасности. Координация реагирования на инциденты безопасности с соответствующими командами.
Требования
- Диплом бакалавра в области компьютерных наук или смежных дисциплин; 5+ лет опыта в DevOps/SRE/облачной инфраструктуре. Практический опыт работы в крупных производственных средах, проектировании инфраструктуры и решении сложных инцидентов. Высокий уровень осознания рисков и навыки межкомандного взаимодействия.
- Глубокие знания Linux, сетевых технологий и контейнеризации. Подтвержденный опыт настройки, обновления, оптимизации и устранения неполадок кластеров Kubernetes/EKS (на уровне Pod/Node/сети). Знание сред Java/Go и методов отладки.
- Опыт работы с основными сервисами AWS в production (IAM, VPC, EC2, EKS, ALB/NLB, Route 53, S3, CloudWatch). Понимание multi-AZ, высокой доступности, сетевой изоляции, принципа минимальных привилегий, автомасштабирования, планирования ресурсов и оптимизации затрат. Способность проектировать инфраструктуру, оценивать риски и решать проблемы.
- Навыки работы с IaC/CI/CD/автоматизацией (Terraform/Terragrunt, GitHub Actions, Ansible). Владение скриптовыми языками (Bash/Python) для повышения надежности инфраструктуры и развертывания.
- Экспертиза в области наблюдаемости и управления стабильностью (Prometheus, Grafana, ELK/Loki, OpenTelemetry). Знание Metrics/Logs/Tracing, SLI/SLO, алертинга, планирования ресурсов и аварийного восстановления.
- Опыт эксплуатации MySQL/Redis/Kafka в production. Знания в области безопасности/DevSecOps (IAM, RBAC, безопасность сети/контейнеров, Secrets/KMS, управление уязвимостями, аудиты). Умение выявлять и минимизировать риски безопасности.
- Предпочтителен опыт в Web3/Crypto-индустрии, понимание механики блокчейна и рисков торговли цифровыми активами.
Желательные навыки
- Опыт работы с высокодоступными системами реального времени (например, криптобиржи, финансы, платежи).
- Работа в крупных Kubernetes/EKS-средах с высокой нагрузкой, управление multi-account AWS, кросс-региональное аварийное восстановление или учения по DR.
- Продвинутые практики cloud-native/безопасности/оптимизации затрат (Karpenter, Argo CD/Flux, OpenTelemetry, eBPF, FinOps).
Условия
- Высококонкурентная зарплата.
- Спонсорство рабочей визы в Сингапур.
- Плоская иерархия и инклюзивная корпоративная культура.
- Щедрая политика отпусков (ежегодных/больничных), выходные и отличные условия работы.