Site Reliability Engineer

Banco Daycoval

**Principais Atividades:** Garantir a confiabilidade, disponibilidade e performance dos serviços e sistemas em produção. Definir e acompanhar SLIs, SLOs e SLAs em conjunto com os times de desenvolvimento Projetar e implementar soluções de observabilidade (métricas, logs e traces) para identificação proativa de incidentes. Realizar análises de causa raiz (post\-mortems) e propor ações corretivas e preventivas. Automatizar tarefas operacionais. Participar de discussões técnicas sobre arquitetura, capacidade e resiliência dos sistemas. Atuar na resposta a incidentes e na melhoria contínua dos processos. **Requisitos e qualificações:** É muito importante que você tenha e/ou saiba: Sólidos conhecimentos em Linux, redes, Docker e Kubernetes. Experiência com ferramentas de observabilidade (Datadog, Prometheus, Grafana, Jaeger, ELK Stack ou similares). Experiência em construção de scripts e automações para operações (Python, Go ou Shell Script). Conhecimento dos conceitos de SRE: error budgets, SLIs/SLOs/SLAs e incident management. Experiência com infraestrutura como código (Ansible ou similares). Conhecimento em pipelines CI/CD e práticas de entrega contínua. **Diferenciais:** Experiência com Chaos Engineering Conhecimento em CNI Cilium Engenharia de plataforma e construção de Internal Developer Platforms (IDPs). Experiência em projetos de desenvolvimento de software.