Все вакансии

SRE / Platform Engineer

АО ТМГТ
от 300 000 до 380 000 ₽МоскваHH.ru

Описание вакансии

О роли Мы выделяем надёжность в отдельную полноценную функцию и ищем двух инженеров, которые возьмут на себя SLO, инцидент-менеджмент, CI/CD и эксплуатацию блокчейн-нод. Вы будете отвечать за то, чтобы система, работающая с деньгами, была доступна всегда — и чтобы инженеры могли деплоиться быстро и безопасно. Чем предстоит заниматься - Определение и внедрение SLO/SLI, error budgets, алертинг на их основе. - Построение и развитие CI/CD, инфраструктура как код (Terraform или аналоги). - Эксплуатация облачной инфраструктуры (AWS): отказоустойчивость, масштабирование, стоимость. - Развёртывание, мониторинг и обновление блокчейн-нод и валидаторов; контроль синхронизации и аптайма. - Инцидент-менеджмент: он-колл ротация, постмортемы, устранение классов проблем. - Observability: метрики, логи, трейсинг (Prometheus/Grafana/OpenTelemetry или аналоги). - Внутренние инструменты и самообслуживание для разработчиков. Что мы ожидаем - 4+ года в SRE/DevOps/Platform-роли в продуктовых компаниях. - Сильный опыт с AWS, Kubernetes/контейнерами, Terraform. - Опыт построения CI/CD и наблюдаемости с нуля или значительного их развития. - Опыт он-колла и работы с инцидентами в системах с высокой ценой простоя. - Скриптинг/разработка на Python или Go. Будет плюсом - Опыт эксплуатации блокчейн-нод/валидаторов (понимание рисков слэшинга, апгрейдов сети). - Опыт в финтехе: требования к аудиту изменений, разграничению доступа. - Практика SRE по Google-модели: error budgets, toil reduction. Условия - Работа над продуктом с реальной технической глубиной: собственная инфраструктура, высокие требования к безопасности и надёжности. - Прямое влияние на архитектуру и процессы — вы будете строить функцию, а не поддерживать чужую. - Небольшая сильная команда без бюрократии, быстрые решения.
Открыть оригинал на HH.ru