SRE Pleno

SRM · São Paulo, SP, BR

**Site Reliability Engineer (SRE) Pleno** ========================================= **Objetivo da posição** ----------------------- Atuar na sustentação, administração, observabilidade e evolução dos ambientes de infraestrutura e aplicações, garantindo disponibilidade, estabilidade, segurança e desempenho dos serviços. O profissional será responsável principalmente pela administração dos ambientes AWS, Kubernetes, soluções de backup Veeam/AWS e observabilidade através do Datadog, atuando também na análise e resolução de incidentes. **Principais responsabilidades** -------------------------------- ### **Administração de Recursos AWS** * Administrar e acompanhar recursos e serviços hospedados na AWS. * Realizar troubleshooting de infraestrutura, conectividade, disponibilidade e performance. * Acompanhar utilização e capacidade dos recursos. * Apoiar provisionamento, configuração e manutenção dos ambientes. * Administrar recursos como EC2, EBS, S3, IAM, VPC, Load Balancers, Route 53 e demais serviços utilizados pela organização. * Analisar eventos, logs e métricas através de CloudWatch e CloudTrail. * Apoiar aplicação de boas práticas de segurança, disponibilidade e controle de acesso. * Participar da análise e otimização de custos e recursos AWS. * Apoiar processos de atualização, manutenção e mudanças de infraestrutura. ### **Administração de Backup Veeam e AWS** * Administrar e monitorar rotinas de backup através do Veeam e serviços AWS. * Acompanhar execução, sucesso e falhas dos jobs de backup. * Investigar e corrigir falhas relacionadas às rotinas de backup. * Executar e acompanhar procedimentos de restore quando necessário. * Realizar testes periódicos de recuperação para garantir a integridade dos backups. * Apoiar políticas de retenção, armazenamento e ciclo de vida dos backups. * Acompanhar capacidade e utilização dos repositórios de backup. * Apoiar procedimentos relacionados a Disaster Recovery e continuidade de negócio. * Manter documentação e evidências das rotinas e testes de recuperação. ### **Administração de Clusters Kubernetes** * Administrar e monitorar clusters Kubernetes. * Acompanhar Pods, Deployments, StatefulSets, DaemonSets, Services, Ingress, ConfigMaps e Secrets. * Realizar troubleshooting de aplicações e workloads executados nos clusters. * Analisar eventos, logs, probes, consumo de CPU/memória e comportamento dos Pods. * Investigar problemas como CrashLoopBackOff, ImagePullBackOff, OOMKilled, falhas de probes e indisponibilidade de aplicações. * Apoiar atualização e manutenção dos clusters e seus componentes. * Administrar namespaces, permissões e recursos dos ambientes. * Apoiar configurações de escalabilidade, requests, limits e autoscaling. * Trabalhar em conjunto com os times de desenvolvimento na análise de problemas das aplicações. * Apoiar processos de deploy e operação de aplicações utilizando práticas de CI/CD e GitOps. ### **Administração de Observabilidade e Datadog** * Administrar e manter dashboards no Datadog. * Criar e evoluir dashboards técnicos e operacionais. * Criar e ajustar monitors e alertas. * Acompanhar métricas de infraestrutura e aplicações. * Realizar análise de logs, métricas e traces para troubleshooting. * Utilizar recursos de APM para identificação de gargalos e falhas de aplicações. * Acompanhar indicadores de disponibilidade, latência, erros e saturação. * Apoiar definição e acompanhamento de SLIs e SLOs. * Revisar alertas buscando redução de falsos positivos e melhoria da qualidade da monitoração. * Apoiar times técnicos durante incidentes utilizando dados de observabilidade para identificação da causa raiz. **Atuação operacional** ----------------------- O profissional também deverá: * Atuar no atendimento e resolução de incidentes de infraestrutura e aplicações. * Realizar troubleshooting de problemas de média complexidade. * Participar de análises de causa raiz (RCA). * Registrar procedimentos, incidentes e soluções em documentação técnica. * Executar mudanças seguindo os processos internos de Change Management. * Trabalhar em conjunto com os times de SRE, Infraestrutura, Redes, Segurança, Banco de Dados e Desenvolvimento. * Apoiar automações para redução de atividades operacionais manuais. * Participar da evolução contínua dos ambientes e processos de confiabilidade. **Conhecimentos técnicos desejados** ------------------------------------ * AWS. * Kubernetes. * Veeam Backup \& Replication. * Datadog. * Linux. * Redes TCP/IP, DNS, HTTP/HTTPS e troubleshooting de conectividade. * Conceitos de containers e Docker. * Git. * CI/CD. * Shell Script e/ou Python. * Terraform ou outra ferramenta de Infrastructure as Code. * Conceitos de observabilidade: métricas, logs e traces. * Conceitos de alta disponibilidade, backup e Disaster Recovery. * Conhecimentos básicos de segurança em ambientes Cloud. **Perfil esperado** ------------------- Buscamos um profissional de nível pleno, com autonomia para executar atividades operacionais e troubleshooting de méd