Site Reliability Engineer (SRE)

Dataside · Remoto, BR

**SITE RELIABILITY ENGINEER (SRE)** =================================== **Papel na empresa:** Como SRE você será o ponto focal técnico para garantir confiabilidade, disponibilidade, performance e segurança dos serviços em produção, atuando na prevenção e resposta a incidentes críticos e na evolução contínua da operação. Este papel envolve liderar e executar práticas de SRE (observabilidade, SLI/SLO, post\-mortem, automação e governança de mudanças), garantindo estabilidade dos sistemas em AWS. Além disso, você irá orientar tecnicamente o time, disseminando boas práticas e elevando o padrão operacional. ### **Responsabilidades** * Ser referência técnica e atuar como **ponto focal em incidentes críticos e War Rooms**, coordenando ações, mitigação e comunicação; * Implementar e evoluir práticas de SRE: definição e acompanhamento de **SLI/SLO**, gestão de **error budget** e melhoria contínua baseada em dados; * Realizar **análise de tendências** (incidentes recorrentes, gargalos, alertas ruidosos) para ações preventivas e redução estrutural de riscos; * Conduzir e revisar **GMUDs complexas** com visão estratégica de impacto no negócio, riscos, rollback e validação pós\-mudança; * Acompanhar, revisar e evoluir os processos de **observabilidade** (métricas, logs e traces), garantindo: + Dashboards acionáveis; + Alertas bem calibrados (redução de ruído); + Priorização e classificação de eventos. * Atuar no desenho e melhoria de confiabilidade de workloads em **AWS**, com foco em: + **ECS Fargate** (deploy, escalabilidade, capacidade, tuning e troubleshooting); + **Rede AWS** (VPC, conectividade, segurança e desempenho); + **Mensageria (RabbitMQ/AmazonMQ)** (saúde, filas, throughput, latência e padrões de falha). * Criar e manter **runbooks/playbooks**, padronizando resposta a incidentes e reduzindo MTTR; * Orientar e apoiar tecnicamente profissionais juniores e plenos, promovendo excelência operacional; * Identificar oportunidades de **automação** (scripts, pipelines, padronizações) para ganho de eficiência e redução de falhas humanas; * Participar de decisões arquiteturais junto às áreas técnicas (Dev, Infra, Arquitetura), influenciando escolhas com foco em confiabilidade; * Garantir alinhamento com stakeholders e **gestão de crises** com clareza, agilidade e transparência. ### **Requisitos** * Sólida experiência com operação/sustentação de ambientes críticos e alta disponibilidade; * Domínio de AWS (serviços essenciais e arquitetura distribuída), com foco em: + VPC / Redes; + IAM; + Load Balancer (ALB/NLB); + CloudWatch (e serviços correlatos). * Experiência com **mensageria**: **RabbitMQ** e/ou **AmazonMQ** (idealmente ambos); * Conhecimento forte em **rede** (conceitos e prática em cloud): subnets, rotas, SG/NACL, DNS, conectividade e troubleshooting; * Experiência com ferramentas de **monitoramento/observabilidade** (Datadog, Prometheus, OpenTelemetry, Zabbix, Grafana, CloudWatch); * Forte habilidade em **troubleshooting** de infraestrutura, redes e sistemas em produção; * Experiência com **Linux**; * Conhecimentos em bancos de dados relacionais (**MySQL, PostgreSQL**) para apoio em análise e diagnóstico; * Perfil de liderança técnica, proatividade e excelente comunicação para atuação em crise; * Participação em projetos de **automação, confiabilidade, observabilidade ou SRE**; * Vivência com governança de mudanças (**GMUD/Change Management**) e operação orientada a processos. ### **Hard Skills** * **AWS:** domínio de serviços essenciais e arquitetura distribuída, incluindo VPC / Redes, IAM, Load Balancer (ALB/NLB) e CloudWatch (e serviços correlatos). * **Mensageria:** experiência com **RabbitMQ** e/ou **AmazonMQ** (idealmente ambos). * **Redes:** conhecimento forte em conceitos e prática em cloud, incluindo subnets, rotas, SG/NACL, DNS, conectividade e troubleshooting. * **Monitoramento e Observabilidade:** experiência com Datadog, Prometheus, OpenTelemetry, Zabbix, Grafana e CloudWatch. * **Troubleshooting:** forte habilidade em infraestrutura, redes e sistemas em produção. * **Linux:** experiência com ambientes Linux. * **Bancos de Dados:** conhecimentos em bancos de dados relacionais, incluindo **MySQL e PostgreSQL**, para apoio em análise e diagnóstico. * **SRE:** experiência com observabilidade, SLI/SLO, post\-mortem, automação e governança de mudanças. * **ECS Fargate:** deploy, escalabilidade, capacidade, tuning e troubleshooting. ### **Soft Skills** * Perfil de liderança técnica, proatividade e excelente comunicação para atuação em crise. * Capacidade de orientar e apoiar tecnicamente profissionais juniores e plenos, promovendo excelência operacional. * Capacidade de atuar como ponto focal em incidentes críticos e War Rooms, coordenando ações, mitigação e comunicação. * Capacidade de garantir alinhamento com stakeholders e gestão de crises com clareza, agilidade e transparência. ### **Certificações / Diferenciais** * Experiência com **Infra as Code** (Terraform / CloudFormation); * Experiência com C