Na CI\&T , ajudamos grandes empresas a transformar o potencial da AI em impacto real nos negócios com AI Deployment, execução AI\-native e tech\-integrated business solutions. Com 30 anos de experiência em transformação tecnológica, aceleramos inovação com expertise em agentic SDLC, application modernization, Data \& AI, martech e business strategy. Somos 8\.000 CI\&Ters em mais de 25 países, colaborando para construir soluções com impacto real. AI já faz parte da forma como trabalhamos, evoluímos e inovamos todos os dias. **Importante**: se você reside na Região Metropolitana de Campinas, sua presença nos escritórios da cidade será obrigatória, conforme a política de frequencia vigente. Atuar no desenvolvimento e evolução dos componentes core da plataforma de IA, com foco na orquestração de modelos e tenants, LiteLLM e integrações com provedores de LLM, contribuindo para uma plataforma multi\-cloud, observável, resiliente e escalável. A posição terá atuação tanto no desenvolvimento de novas funcionalidades quanto na manutenção e suporte dos serviços existentes, exigindo proximidade com os produtos consumidores da plataforma, entendimento dos processos de negócio e capacidade de investigar e resolver problemas em produção. **Responsabilidades** * Desenvolver e evoluir as soluções de governança de modelos, provedores, configurações, tenants e políticas da plataforma, mecanismos de roteamento, load balancing, fallback, controle de custos e políticas de utilização dos modelos * Desenvolver e evoluir as camadas de integração com a LiteLLM, atuando na camada de inferência, roteamento e diferentes provedores de LLM * Integrar e operar modelos e serviços de IA em diferentes clouds, incluindo Azure OpenAI, Azure AI Foundry, AWS Bedrock e GCP Vertex AI * Implementar e evoluir mecanismos de observabilidade, incluindo métricas, logs, traces e dashboards para acompanhamento de latência, throughput, erros, consumo e custos * Investigar e solucionar incidentes e problemas reportados pelos usuários e consumidores da plataforma, atuando em conjunto com o time de suporte técnico da plataforma * Participar do refinamento técnico de novas funcionalidades, entendendo o processo e a aplicação antes de propor ou implementar soluções * Trabalhar na identificação de gargalos de performance, disponibilidade, escalabilidade e confiabilidade dos serviços * Desenvolver APIs e integrações entre os componentes da plataforma, mantendo compatibilidade com serviços e consumidores existentes * Contribuir para a evolução da arquitetura da plataforma, propondo melhorias técnicas e identificando riscos relacionados às mudanças * Documentar decisões técnicas, integrações, configurações e procedimentos operacionais dos serviços * Trabalhar de forma colaborativa com os demais times que utilizam a plataforma, ajudando a identificar problemas de integração e orientar o uso correto dos serviços * Atuar com autonomia na investigação de problemas, buscando entender o processo, a aplicação e o impacto para o negócio, e não apenas o componente técnico isoladamente **Requisitos técnicos** * Experiência sólida em desenvolvimento backend (Kotlin/Java, Node.js) * Conhecimentos em LLMs e aplicações baseadas em IA generativa * Conhecimento em integração e operação de modelos através de provedores como: Azure, OpenAI, Azure AI Foundry, AWS Bedrock, GCP Vertex AI * Conhecimento de LLM routing, load balancing, fallback, streaming, token management e prompt caching * Conhecimento de PostgreSQL e/ou MongoDB * Experiência com observabilidade e monitoramento, incluindo Grafana, Prometheus e ferramentas similares * Conhecimento de métricas de aplicações distribuídas, como latência, throughput, error rate, p90/p95/p99, TTFT e consumo de tokens * Conhecimento de MCP (Model Context Protocol) e conceitos relacionados à integração de agentes * Conhecimento de AI Agents / Agentic AI * Conhecimento de RAG (Retrieval\-Augmented Generation) e seus principais componentes * Experiência com Docker e Kubernetes * Experiência com Git e pipelines de CI/CD * Experiência em desenvolvimento e operação de sistemas em cloud pública * Capacidade de atuar em sistemas distribuídos, investigando problemas que podem envolver múltiplos serviços, aplicações, clouds e provedores * Boa capacidade de investigação e troubleshooting, incluindo análise de logs, métricas, traces e comportamento dos serviços **Diferenciais** * Experiência prática com LiteLLM, incluindo Router, deployments, callbacks, customizações e configuração do proxy * Experiência com Azure AI Foundry, AWS Bedrock e GCP Vertex AI em cenários de produção * Experiência com arquiteturas de AI Gateway / LLM Gateway / Model Gateway * Conhecimento de LLM observability, incluindo Langfuse, OpenTelemetry, Prometheus, Grafana * Experiência com LangChain, LangGraph, Semantic Kernel ou frameworks similares * Conhecimento de vector databases e mecanismos de busca semântica * Experiência com guardrails, segurança e proteção de dados em aplicaç