Site Reliability Engineer (SRE)

Proative Soluções em Tecnologia da Informação Ltda · Barueri, SP, BR

A Proative Technology é especialista em **serviços gerenciados de TI** e acredita que **pessoas incríveis constroem empresas extraordinárias**. Somos reconhecidos como **Great Place to Work**, reforçando nosso compromisso com um ambiente colaborativo, inclusivo e orientado ao desenvolvimento. Se você busca atuar em ambientes de alta disponibilidade, contribuindo para a confiabilidade dos serviços e apoiando a evolução tecnológica das operações, a Proative é o lugar certo para você. Estamos em busca de um **Site Reliability Engineer (SRE)** para atuar na sustentação, monitoramento e evolução de ambientes críticos, garantindo a disponibilidade, performance e confiabilidade dos serviços. Procuramos um profissional com perfil analítico, foco em automação e melhoria contínua, capaz de atuar na prevenção e resolução de incidentes e na construção de ambientes cada vez mais resilientes, escaláveis e alinhados às necessidades do negócio. **Responsabilidades** * Monitorar a **disponibilidade, desempenho e saúde dos ambientes e aplicações**; * Atuar na **identificação, análise e resolução de incidentes**, minimizando impactos ao negócio; * Desenvolver e implementar **automações** para otimização de processos operacionais; * Administrar e sustentar **ambientes cloud e infraestrutura crítica**; * Configurar e evoluir soluções de **observabilidade, monitoramento, métricas, logs e alertas**; * Participar da definição e acompanhamento de indicadores de **confiabilidade, disponibilidade e performance**; * Apoiar equipes de desenvolvimento na construção de aplicações **resilientes e escaláveis**; * Realizar **análise de causa raiz (RCA)** e propor melhorias contínuas para prevenção de incidentes; * Contribuir para a evolução das práticas de confiabilidade, estabilidade e eficiência operacional. **Qualificações Necessárias** * Ensino superior completo em **Tecnologia da Informação, Engenharia, Ciência da Computação ou áreas correlatas**; * Experiência prévia em funções relacionadas a **SRE, DevOps, Cloud ou Infraestrutura**; * Conhecimento sólido em **Linux**; * Experiência com ambientes **Cloud (AWS, Azure ou GCP)**; * Vivência em troubleshooting e gestão de incidentes em ambientes produtivos; * Perfil analítico e orientado à resolução de problemas. **Conhecimentos Técnicos** * Experiência com ambientes **AWS, Azure ou GCP**; * Conhecimento em **Linux** e administração de ambientes produtivos; * Experiência com **Docker e Kubernetes**; * Conhecimento em ferramentas de **observabilidade, monitoramento, métricas e logs**; * Experiência com soluções como **Grafana, Prometheus, Datadog, Zabbix ou similares**; * Vivência com **automação de infraestrutura** e **Infrastructure as Code (Terraform, Ansible ou similares)**; * Conhecimento em **pipelines CI/CD**; * Experiência em **troubleshooting e gestão de incidentes** em ambientes produtivos; * Conhecimento em **SLI, SLO, SLA e Error Budget**; * Conhecimento em **redes, segurança e arquitetura de ambientes cloud**. **Desejável** * Certificações Cloud (**AWS, Azure ou GCP**); * Experiência com **GitOps**; * Conhecimento em **SLI, SLO, SLA e Error Budget**; * Vivência em ambientes de **alta disponibilidade e missão crítica**; * Conhecimento em **segurança de ambientes cloud e containers**; * Experiência com práticas de confiabilidade e melhoria contínua.