Especialista em SRE
Cielo Pagamentos · Barueri, SP, BR
Somos mais que uma máquina, somos pessoas que transformam e **criam infinitas possibilidades.** Trabalhamos para **simplificar e impulsionar negócios para todas as pessoas**, oferecendo soluções financeiras inteligentes. Aqui, investimos em **tecnologia**, promovemos **desenvolvimento** e fomentamos a **inovação** para criar novos caminhos possíveis e gerar impacto positivo no mundo. Na Cielo, a gente trabalha com **autonomia** para escrever nossa própria jornada, **liberdade** para ser quem a gente é, e a oportunidade de **fazer acontecer**. Somos um time que **sonha no plural**, oferecendo uma experiência completa e focando no bem\-estar físico e mental de nossos mais de 7\.000 colaboradores e suas famílias. Acreditamos na **inclusão e acolhimento** de todas as pessoas, com suas singularidades e diversidade de vivências. Bora realizar seus sonhos com a gente! **Responsabilidades e atribuições** ----------------------------------- **Tem lugar para você nesse propósito:** * Definir e evoluir práticas de confiabilidade por meio da gestão de SLI, SLO e Error Budgets, promovendo maior disponibilidade, resiliência e maturidade operacional das plataformas críticas; * Liderar a resposta a incidentes complexos, conduzindo análises de causa raiz (RCA), reduzindo MTTR e implementando melhorias contínuas nos serviços; * Projetar e implementar automações para provisionamento, monitoração, gestão de configuração, deploys e auto\-remediação, eliminando atividades operacionais repetitivas e aumentando a eficiência da operação; * Desenvolver e evoluir plataformas self\-service, promovendo a adoção de práticas como GitOps e Infraestrutura como Código (IaC) para acelerar a entrega e a operação dos ambientes; * Definir padrões e evoluir a estratégia de observabilidade corporativa, abrangendo monitoramento, métricas, logs, tracing, OpenTelemetry e dashboards executivos e operacionais; * Identificar, avaliar e implementar soluções de IA e AIOps para automação operacional, correlação de eventos, troubleshooting e geração de insights; * Atuar na definição de arquiteturas escaláveis, resilientes e observáveis, apoiando iniciativas de modernização tecnológica, adoção de cloud e evolução das plataformas corporativas; * Influenciar e disseminar boas práticas de SRE junto aos times de engenharia, contribuindo para a evolução contínua da confiabilidade e excelência operacional. **Requisitos e qualificações** ------------------------------ **O que o \#TimeCielo espera de você?** * Experiência sólida em Site Reliability Engineering (SRE), Engenharia de Plataforma, Infraestrutura ou DevOps, atuando em ambientes críticos e de alta disponibilidade; * Conhecimento avançado em Linux Enterprise, Kubernetes e ecossistema cloud\-native; * Experiência com ambientes AWS e/ou Azure, incluindo arquiteturas distribuídas, microsserviços e serviços gerenciados; * Vivência com Infraestrutura como Código, GitOps e automação utilizando ferramentas como Terraform, Ansible, Python, Shell Script ou Go; * Experiência na construção e evolução de pipelines CI/CD e estratégias de automação para provisionamento, deploy e operação de ambientes; * Conhecimento em observabilidade, monitoramento e telemetria, utilizando ferramentas como Dynatrace, Datadog, Prometheus, Grafana, OpenTelemetry e APM; * Experiência com containers e plataformas Kubernetes, incluindo EKS, AKS, OpenShift ou equivalentes; * Vivência com práticas de confiabilidade, incluindo SLI, SLO, SLA, Error Budget, gestão de incidentes e análise de causa raiz (RCA); * Conhecimento de segurança de infraestrutura, hardening e gestão de vulnerabilidades. **O que aumentam suas chances?** * Experiência com IA Generativa, agentes inteligentes e soluções de AIOps aplicadas à operação e observabilidade; * Conhecimento em frameworks e plataformas de IA, como LangChain, Semantic Kernel, OpenAI, Azure AI Foundry ou similares; * Experiência com automação orientada a eventos, workflows inteligentes e auto\-remediação; * Certificações em Cloud, Kubernetes, Terraform ou SRE (AWS, Azure, CKA/CKAD, HashiCorp Terraform Associate, SRE Foundation, entre outras); * Conhecimento em FinOps e otimização de custos em ambientes cloud; * Inglês avançado ou fluente. **Informações adicionais** -------------------------- **Por que viver infinitas possibilidades ao nosso lado?** * Assistência Médica e Odontológica; * Remuneração Variável Anual (PPR); * Auxílio Refeição e Alimentação; * Fretado/vale\-transporte ou estacionamento; * Modelo Híbrido; * Auxílio Trabalho Remoto; * Seguro de Vida; * Seguro residencial e automóvel; * Assistência funeral familiar; * Previdência Privada; * Canal de apoio à especialistas (nutrição, psicologia, ginecologia, etc); * Campanha de Vacinação; * Acesso à diversos cursos em nossa plataforma Educa; * Wellhub; * Programa de Gestação Saudável; * Licença Maternidade e Paternidade estendida; * Auxílio Creche; * Day Off de Aniversário; * Dress Code Flexível; * Horário Flexível; * Sexta curta; * Almoço estend