Analista de SRE Pleno - Vaga Afirmativa para Mulheres
Serasa · São Carlos, SP, BR
**Company Description** ----------------------- A Experian é uma empresa global de dados e tecnologia que impulsiona oportunidades para pessoas e empresas ao redor do mundo. Atuamos em diversos mercados, como serviços financeiros, saúde, automotivo, agronegócio, seguros, entre outros. A Experian investe em pessoas e em novas tecnologias avançadas para liberar o poder dos dados. Contamos com uma equipe incrível de 25\.200 colaboradores em 32 países. Nossa singularidade é valorizar a sua. A cultura da Experian, centrada nas pessoas, inclusiva e orientada por propósito, é reconhecida por diversos prêmios — incluindo World’s Best Workplaces™ 2025 (Top 25 global da Fortune) e Great Place To Work™ em 26 países, entre outros. Confira o Experian Life nas redes sociais ou explore nosso site de carreiras para entender o porquê. A Experian também se orgulha de ser uma empregadora que promove igualdade de oportunidades e ação afirmativa. **Job Description** ------------------- Estamos em busca de uma **Site Reliability Engineer (SRE)** **Plena** altamente motivada para integrar nossa equipe de **Cloud, Data \& AI Platform**. Nesta função, você será responsável por projetar, operar e aprimorar continuamente a confiabilidade, escalabilidade, observabilidade e desempenho de plataformas cloud\-native que suportam aplicações críticas para o negócio, pipelines de dados e cargas de trabalho de IA/ML. Você trabalhará em estreita colaboração com as equipes de Engenharia de Software, Engenharia de Dados, Engenharia de IA e Plataforma para criar sistemas resilientes, automatizar operações, melhorar a experiência dos desenvolvedores e estabelecer as melhores práticas de confiabilidade em toda a organização. Como engenheira plena, você desempenhará um papel fundamental no avanço da excelência operacional por meio de automação, observabilidade, gestão de incidentes, otimização de custos e modernização da infraestrutura. **Principais Responsabilidades:** * Projetar e operar plataformas em nuvem altamente disponíveis, escaláveis e seguras na AWS. * Construir e manter infraestrutura baseada em Kubernetes para suportar aplicações, dados e cargas de trabalho de IA. * Melhorar a confiabilidade da plataforma por meio de automação, Infraestrutura como Código (IaC) e recursos de autoatendimento (self\-service). * Implementar e aprimorar soluções de observabilidade utilizando Datadog, incluindo monitoramento, logs, rastreamento (tracing), alertas, dashboards e gestão de SLOs. * Suportar e otimizar ambientes de processamento de dados em larga escala utilizando Airflow, Amazon EMR, S3 e outros serviços de dados da AWS. * Trabalhar em parceria com as equipes de Dados e IA para melhorar a confiabilidade, escalabilidade e maturidade operacional de plataformas de Machine Learning e Inteligência Artificial. * Liderar atividades de resposta a incidentes, análises de causa raiz e revisões pós\-incidente, promovendo a melhoria contínua. * Definir e medir Indicadores de Nível de Serviço (SLIs), Objetivos de Nível de Serviço (SLOs) e orçamentos de erro (error budgets). * Aprimorar processos de implantação, pipelines de CI/CD e a confiabilidade das releases. * Otimizar a utilização, desempenho e custos da infraestrutura em nuvem. * Mentorar membros da equipe e promover as melhores práticas de SRE em toda a organização de engenharia. **O que define o sucesso nessa função** * Aumento da disponibilidade e confiabilidade da plataforma. * Melhoria da observabilidade e redução do tempo de resolução de incidentes. * Maior automação e redução de esforços operacionais manuais e repetitivos. * Plataformas de Dados e IA confiáveis, escaláveis e com eficiência de custos. * Forte colaboração com as equipes de Engenharia para entregar sistemas de produção resilientes. **Qualifications** ------------------ **Qualificações obrigatórias** * Ensino Superior cursando/completo. * Experiência sólida em Site Reliability Engineering, Platform Engineering, Cloud Engineering ou funções de DevOps. * Forte experiência prática com serviços AWS e arquiteturas cloud\-native. * Conhecimento profundo de Kubernetes e workloads conteinerizadas em ambientes de produção. * Experiência na gestão e resolução de problemas em sistemas distribuídos de grande escala. * Sólida experiência com plataformas de observabilidade, preferencialmente Datadog. * Experiência no suporte a plataformas e fluxos de dados utilizando tecnologias como Airflow, EMR, Spark e S3\. * Expertise em Infraestrutura como Código (IaC) utilizando Terraform ou ferramentas similares. * Experiência na construção e manutenção de pipelines de CI/CD e automação de plataformas. * Sólidos conhecimentos em Linux, redes e troubleshooting de desempenho de sistemas. * Proficiência em scripts e automação utilizando Python, Bash ou linguagens similares. **Qualificações desejáveis** * Experiência no suporte a plataformas cloud\-native de grande escala em ambientes AWS. * Experiência com operações de plataformas Kubernetes e gerenciamento do