← Todas as vagas
Site Reliability Engineer (SRE) – GCP Platform
Vagas Externas — Remotar
· São Paulo/SP
· hybrid
· CLT
· especialista
Descrição
SRE com experiência em GCP, Kubernetes e Terraform para otimização de infraestrutura e automação.
A Kstack está em busca de um(a) Site Reliability Engineer (SRE) com foco em Google Cloud Platform (GCP) para atuar na melhoria da confiabilidade, escalabilidade e resiliência de plataformas e infraestruturas digitais. Este profissional operará na interseção da engenharia de software e sistemas, com foco na construção de automação para eliminar tarefas manuais e prevenir proativamente incidentes que impactam o serviço. O SRE irá projetar, construir e suportar sistemas distribuídos, tolerantes a falhas e em larga escala no Google Cloud Platform (GCP), garantindo alta disponibilidade e desempenho das plataformas críticas de negócios, ao mesmo tempo em que suporta um ritmo rápido de implantação de funcionalidades.
- Projetar, construir e manter ferramentas de automação e infraestrutura como código (IaC) para eliminar tarefas operacionais manuais e otimizar fluxos de trabalho de implantação.
- Colaborar com equipes de produto e desenvolvimento para definir, monitorar e aplicar Indicadores de Nível de Serviço (SLIs) e Objetivos de Nível de Serviço (SLOs) para serviços críticos.
- Projetar e implementar sistemas robustos de monitoramento, alerta e log para garantir visibilidade profunda da saúde da aplicação e da infraestrutura.
- Participar de um rodízio de plantão para fornecer suporte operacional. Liderar e participar de análises post-mortem sem culpa para identificar causas-raiz e implementar medidas preventivas.
- Otimizar a infraestrutura de nuvem GCP para desempenho, custo e escalabilidade. Gerenciar balanceamento de carga, roteamento de tráfego e configurações de autoescalonamento.
- Suportar e aprimorar pipelines de integração contínua e implantação contínua (CI/CD) para garantir lançamentos de software seguros, previsíveis e frequentes.
- Planejar, implementar e testar estratégias de recuperação de desastres, failover e backup para garantir a continuidade dos negócios.
- Revisar a arquitetura e o código da aplicação para garantir a adesão aos padrões de prontidão para produção, melhores práticas de segurança e diretrizes de escalabilidade.
Processo seletivo inclui:
Selecionamos as principais informações da posição. Para conferir o descritivo completo, clique em "acessar"
Candidatar-se
Esta vaga é agregada de Vagas Externas — Remotar. A candidatura é feita no site da fonte.
Candidatar-se no site da fonte