**Descrição da vaga** Buscamos uma Pessoa Engenheira de Dados Júnior para atuar dedicada em um banco digital de grande porte, em plena expansão, contribuindo na construção e na evolução de pipelines de dados que sustentam produtos, análises e modelos de negócio do banco. Você fará parte de um time de plataforma de dados em ambiente AWS, participando do ciclo completo dos dados — da ingestão e transformação em PySpark à disponibilização em camadas de Data Lake / Lakehouse — com acompanhamento de pessoas engenheiras sêniores, exposição a arquitetura moderna de dados em escala e uso de IA aplicada ao dia a dia de engenharia. É uma posição de crescimento, com espaço para aprender, assumir responsabilidades gradualmente e evoluir tecnicamente. **Responsabilidades e atribuições** * Desenvolver e manter pipelines de dados em Python / PySpark, seguindo padrões definidos pelo time. * Escrever e ajustar consultas SQL para extração, transformação e validação de dados. * Apoiar a ingestão de dados de diferentes fontes (bancos relacionais, APIs, eventos) para o Data Lake em AWS (S3, Glue, Athena, EMR). * Participar da construção e manutenção de DAGs de orquestração no Airflow, sob orientação técnica. * Aplicar boas práticas de modelagem em arquitetura medalhão (bronze, prata, ouro) e formatos colunares (Parquet / Delta). * Implementar validações e checagens de qualidade de dados, documentando regras e resultados. * Utilizar Git e a esteira de CI/CD para versionamento, revisão (code review) e deploy dos pipelines. * Apoiar o monitoramento dos pipelines em produção, identificando falhas e ajudando na correção. * Participar de cerimônias ágeis, refinamento de demandas e estimativas junto ao time. * Utilizar ferramentas de IA aplicadas ao desenvolvimento (GitHub Copilot, Claude Code ou similares) para acelerar codificação, testes e documentação, com senso crítico sobre o resultado gerado. **Requisitos e qualificações** * Experiência prática em Python aplicado a dados, ainda que em projetos de menor porte, estágio ou acadêmicos. * Conhecimento de SQL: joins, agregações, CTEs e funções de janela. * Noções de Apache Spark / PySpark (DataFrames, transformações e ações). * Familiaridade com conceitos de Data Lake, Data Warehouse e Lakehouse. * Familiaridade com Git e fluxo de branches / pull requests. * Noções de serviços de dados em nuvem, preferencialmente AWS (S3, Glue, Athena ou EMR). * Vivência ou interesse em metodologias ágeis (Scrum/Kanban). * Formação em andamento ou concluída em Ciência da Computação, Engenharia, Sistemas de Informação, Estatística, Análise e Desenvolvimento de Sistemas ou áreas correlatas. **Diferenciais** * Experiência ou estágio no setor financeiro, bancário ou fintech. * Contato com Airflow ou outra ferramenta de orquestração. * Noções de Kafka ou outras plataformas de streaming de dados. * Contato com Docker, Kubernetes ou Terraform. * Conhecimento de Trino / Presto ou Databricks. * Noções de qualidade de dados, testes de pipeline e observabilidade. * Certificações em AWS ou Databricks (Cloud Practitioner, Data Engineer Associate ou similares). * Uso de ferramentas de IA no fluxo de desenvolvimento. * Inglês para leitura de documentação técnica. **Informações adicionais** * Vale Alimentação e/ou Vale Refeição; * Convênio Sesi e Sesc, oferecendo acesso a serviços de saúde, bem\-estar e lazer; * Parceria com Instituições de Ensino, com descontos exclusivos em cursos e programas educacionais; * Auxílio para Certificações; * Possibilidade de crescimento na empresa e de participação em projetos estratégicos; * Oportunidade de trabalhar em uma empresa do mercado em plena expansão.