Nitka Technologies разрабатывает ПО для клиентов из США и Европы и объединяет около 300 профессионалов из Восточной Европы, Северной и Южной Америки, Армении, Грузии и Казахстана.
Мы ищем опытного Senior SRE Engineer / Platform Reliability Engineer для участия в новом проекте, сфокусированном на надежности. Клиент — банковский холдинг из США, предоставляющий ряд финансовых услуг, включая: розничное банковское обслуживание, коммерческое банковское обслуживание, управление активами и доверительные услуги.
Обязанности
- Работа с сервисными командами для определения практических SLI и SLO.
- Поддержка оповещений на основе SLO и отслеживания бюджетных ошибок.
- Анализ инцидентов, повторяющихся сбоев и рисков надежности.
- Уменьшение шума оповещений и повышение их качества.
- Создание автоматизации для повторяющихся операционных задач с низким уровнем риска.
- Помощь в улучшении безопасности развертывания и готовности к производству.
- Участие в планировании улучшения надежности.
- Работа с Azure, AKS, CI/CD и автоматизацией инфраструктуры.
- Внедрение и улучшение мониторинга, оповещений, дашбордов и руководств.
Требования:
- Значительный опыт в поддержке продакшена или SRE.
- Практический опыт работы с Prometheus, Grafana, CloudWatch, Splunk, Datadog или аналогичными инструментами.
- Опыт работы с реагированием на инциденты, руководствами и постмортемами.
- Опыт работы с облачной инфраструктурой Azure.
- Опыт работы с Terraform или другим инструментом Infrastructure as Code.
- Опыт работы с CI/CD пайплайнами.
- Опыт написания скриптов на Python, Bash или Go.
- Понимание концепций SLI/SLO и метрик надежности.
- Практический опыт работы с OpenTelemetry.
- Отличное владение английским языком (устным и письменным) (Intermediate и выше).
Условия работы:
- Удаленная работа
- Полный рабочий день (8 часов/день)
- Привлекательная компенсация в USD
- Оплачиваемый отпуск, праздники