facilita.etc
← Todas as vagas

Site Reliability Engineer (SRE) – GCP Platform

Vagas Externas — Remotar · São Paulo/SP · hybrid · CLT · especialista

Descrição

SRE com experiência em GCP, Kubernetes e Terraform para otimização de infraestrutura e automação. A Kstack está em busca de um(a) Site Reliability Engineer (SRE) com foco em Google Cloud Platform (GCP) para atuar na melhoria da confiabilidade, escalabilidade e resiliência de plataformas e infraestruturas digitais. Este profissional operará na interseção da engenharia de software e sistemas, com foco na construção de automação para eliminar tarefas manuais e prevenir proativamente incidentes que impactam o serviço. O SRE irá projetar, construir e suportar sistemas distribuídos, tolerantes a falhas e em larga escala no Google Cloud Platform (GCP), garantindo alta disponibilidade e desempenho das plataformas críticas de negócios, ao mesmo tempo em que suporta um ritmo rápido de implantação de funcionalidades. - Projetar, construir e manter ferramentas de automação e infraestrutura como código (IaC) para eliminar tarefas operacionais manuais e otimizar fluxos de trabalho de implantação. - Colaborar com equipes de produto e desenvolvimento para definir, monitorar e aplicar Indicadores de Nível de Serviço (SLIs) e Objetivos de Nível de Serviço (SLOs) para serviços críticos. - Projetar e implementar sistemas robustos de monitoramento, alerta e log para garantir visibilidade profunda da saúde da aplicação e da infraestrutura. - Participar de um rodízio de plantão para fornecer suporte operacional. Liderar e participar de análises post-mortem sem culpa para identificar causas-raiz e implementar medidas preventivas. - Otimizar a infraestrutura de nuvem GCP para desempenho, custo e escalabilidade. Gerenciar balanceamento de carga, roteamento de tráfego e configurações de autoescalonamento. - Suportar e aprimorar pipelines de integração contínua e implantação contínua (CI/CD) para garantir lançamentos de software seguros, previsíveis e frequentes. - Planejar, implementar e testar estratégias de recuperação de desastres, failover e backup para garantir a continuidade dos negócios. - Revisar a arquitetura e o código da aplicação para garantir a adesão aos padrões de prontidão para produção, melhores práticas de segurança e diretrizes de escalabilidade. Processo seletivo inclui: Selecionamos as principais informações da posição. Para conferir o descritivo completo, clique em "acessar"

Candidatar-se

Esta vaga é agregada de Vagas Externas — Remotar. A candidatura é feita no site da fonte.

Candidatar-se no site da fonte