facilita.etc
← Todas as vagas

Analista DevOps Pleno

Vagas Externas — Remotar · remote · CLT · pleno
🌐 Entre para traduzir esta vaga

Descrição

Foco em Cloud Operations e Engenharia de Confiabilidade (SRE) com Kubernetes e Datadog. A nstech, uma plataforma open logistics, busca um(a) Analista DevOps Pleno com foco em Cloud Operations e Engenharia de Confiabilidade (SRE). O profissional será referência técnica para garantir a estabilidade, escalabilidade e resiliência do ecossistema cloud-native baseado em Kubernetes. A missão inclui contribuir com a padronização das esteiras de CI/CD, garantir a governança da infraestrutura via IaC (Infrastructure as Code) e capitanear a estratégia de observabilidade de ponta a ponta, utilizando automação avançada para reduzir o MTTR e implementar mecanismos de auto-reparação. - Definir, padronizar e evoluir o modelo de CI/CD da companhia, garantindo esteiras de deploy rápidas, seguras, automatizadas e com validações de segurança integradas (DevSecOps). - Arquitetar e gerenciar a infraestrutura global via IaC (Infrastructure as Code), garantindo a reprodutibilidade dos ambientes, controle de versão e aplicando práticas recomendadas de mercado. - Evoluir a estratégia de observabilidade utilizando a plataforma Datadog como ferramenta central (do frontend ao banco de dados). - Definir e implementar SLIs, SLOs e Error Budgets junto aos times de produto para garantir a saúde do negócio e das aplicações críticas. - Arquitetar alertas inteligentes e preditivos, explorando capacidades de AIOps para antecipar falhas antes que impactem o cliente final. - Disseminar a cultura de SRE e DevOps, apoiando desenvolvedores na análise de traces distribuídos, gargalos de performance e adoção dos padrões de deploy e infraestrutura. - Liderar a resposta a incidentes críticos como Incident Commander, coordenando war rooms e facilitando a comunicação entre times técnicos e de negócio. - Combater o trabalho manual (toil), priorizando a automação de runbooks e diagnósticos para redução drástica do MTTR. - Facilitar análises de causa raiz (RCA) com foco em melhoria contínua (blameless post-mortems), garantindo que incidentes gerem evolução na plataforma. - Desenhar mecanismos complexos de auto-reparação, como parametrização avançada de liveness/readiness probes, HPA/VPA e resiliência de microsserviços. - Desenvolver ferramentas e scripts (Python, Go, ou Shell) para automatizar a remediação de incidentes e tarefas operacionais. - Colaborar com a equipe de Engenharia de Infraestrutura para evoluir a plataforma de Cloud, garantindo que as fundações de rede, segurança e computação estejam alinhadas com as necessidades de CI/CD e IaC. Processo seletivo inclui: Selecionamos as principais informações da posição. Para conferir o descritivo completo, clique em "acessar"

Candidatar-se

Esta vaga é agregada de Vagas Externas — Remotar. A candidatura é feita no site da fonte.

Candidatar-se no site da fonte