← Todas as vagas
Analista DevOps Pleno
Vagas Externas — Remotar
· remote
· CLT
· pleno
Descrição
Foco em Cloud Operations e Engenharia de Confiabilidade (SRE) com Kubernetes e Datadog.
A nstech, uma plataforma open logistics, busca um(a) Analista DevOps Pleno com foco em Cloud Operations e Engenharia de Confiabilidade (SRE). O profissional será referência técnica para garantir a estabilidade, escalabilidade e resiliência do ecossistema cloud-native baseado em Kubernetes. A missão inclui contribuir com a padronização das esteiras de CI/CD, garantir a governança da infraestrutura via IaC (Infrastructure as Code) e capitanear a estratégia de observabilidade de ponta a ponta, utilizando automação avançada para reduzir o MTTR e implementar mecanismos de auto-reparação.
- Definir, padronizar e evoluir o modelo de CI/CD da companhia, garantindo esteiras de deploy rápidas, seguras, automatizadas e com validações de segurança integradas (DevSecOps).
- Arquitetar e gerenciar a infraestrutura global via IaC (Infrastructure as Code), garantindo a reprodutibilidade dos ambientes, controle de versão e aplicando práticas recomendadas de mercado.
- Evoluir a estratégia de observabilidade utilizando a plataforma Datadog como ferramenta central (do frontend ao banco de dados).
- Definir e implementar SLIs, SLOs e Error Budgets junto aos times de produto para garantir a saúde do negócio e das aplicações críticas.
- Arquitetar alertas inteligentes e preditivos, explorando capacidades de AIOps para antecipar falhas antes que impactem o cliente final.
- Disseminar a cultura de SRE e DevOps, apoiando desenvolvedores na análise de traces distribuídos, gargalos de performance e adoção dos padrões de deploy e infraestrutura.
- Liderar a resposta a incidentes críticos como Incident Commander, coordenando war rooms e facilitando a comunicação entre times técnicos e de negócio.
- Combater o trabalho manual (toil), priorizando a automação de runbooks e diagnósticos para redução drástica do MTTR.
- Facilitar análises de causa raiz (RCA) com foco em melhoria contínua (blameless post-mortems), garantindo que incidentes gerem evolução na plataforma.
- Desenhar mecanismos complexos de auto-reparação, como parametrização avançada de liveness/readiness probes, HPA/VPA e resiliência de microsserviços.
- Desenvolver ferramentas e scripts (Python, Go, ou Shell) para automatizar a remediação de incidentes e tarefas operacionais.
- Colaborar com a equipe de Engenharia de Infraestrutura para evoluir a plataforma de Cloud, garantindo que as fundações de rede, segurança e computação estejam alinhadas com as necessidades de CI/CD e IaC.
Processo seletivo inclui:
Selecionamos as principais informações da posição. Para conferir o descritivo completo, clique em "acessar"
Candidatar-se
Esta vaga é agregada de Vagas Externas — Remotar. A candidatura é feita no site da fonte.
Candidatar-se no site da fonte