**SRE de Plataforma de IA** =========================== **Missão da posição** --------------------- Projetar, construir, automatizar e operar a **Plataforma de Engenharia de IA**, garantindo que aplicações, modelos, LLMs, agentes e serviços de IA possam ser desenvolvidos e executados com segurança, observabilidade, escalabilidade, confiabilidade e governança. O profissional atuará na interseção entre **SRE, Platform Engineering, DevOps, Cloud, Observabilidade e AI Engineering**, construindo a camada de infraestrutura e automação necessária para transformar iniciativas de IA em serviços produtivos e sustentáveis. A posição terá forte atuação em **AWS, Kubernetes, GitOps, Infrastructure as Code, CI/CD, Observabilidade e AI Observability**. **Principais responsabilidades** ================================ **1\. Plataforma AWS** ---------------------- Projetar, administrar e evoluir a infraestrutura AWS utilizada pela plataforma de IA. Responsabilidades: * Administração e evolução de ambientes AWS. * Arquitetura de workloads distribuídos e altamente disponíveis. * Administração de EKS. * ECR para gerenciamento de imagens. * S3 para datasets, artefatos, modelos e logs. * IAM e políticas de acesso. * Secrets Manager e Parameter Store. * Load Balancers e networking. * Route 53\. * CloudWatch. * SQS/SNS/EventBridge para arquiteturas orientadas a eventos. * RDS/Aurora e serviços de persistência quando necessários. * ElastiCache/Redis. * Integração com serviços de IA da AWS. * Gestão de custos, capacidade e eficiência dos workloads. O profissional deverá aplicar conceitos de: **High Availability, Disaster Recovery, Security by Design, FinOps e Well\-Architected Framework.** **2\. Kubernetes e Plataforma de Containers** ============================================= Construir e operar clusters Kubernetes utilizados pelos serviços e workloads de IA. Principais atividades: * Administração de clusters Amazon EKS. * Helm. * Kubernetes Operators. * Ingress Controllers. * Service Accounts e RBAC. * Network Policies. * Secrets. * Persistent Volumes. * Autoscaling. * HPA. * KEDA. * Cluster Autoscaler/Karpenter. * Troubleshooting de workloads Kubernetes. * Capacity Planning. Também será responsável por definir padrões de deployment para: * APIs de IA; * serviços Python; * aplicações Java; * agentes de IA; * gateways; * workers; * pipelines assíncronos; * aplicações de inferência; * ferramentas internas da plataforma. **3\. Infrastructure as Code** ============================== Toda infraestrutura deverá ser tratada como código. Stack principal: **Terraform / OpenTofu \+ Terragrunt \+ Atlantis** Responsabilidades: * desenvolvimento de módulos reutilizáveis; * versionamento da infraestrutura; * revisão de mudanças via Pull Request; * execução automatizada de Plan; * aprovação controlada de Apply; * gestão de múltiplos ambientes; * padronização de módulos; * controle de drift; * políticas de segurança; * automação do ciclo de vida da infraestrutura. O Atlantis deverá funcionar como camada de governança do processo de IaC. Fluxo esperado: Developer Pull Request GitHub Atlantis Terraform / OpenTofu AWS **4\. GitOps e Continuous Delivery** ==================================== Responsável pela implementação e evolução do modelo GitOps da plataforma. Stack principal: **GitHub \+ GitHub Actions \+ ArgoCD \+ Helm** Fluxo esperado: Developer GitHub GitHub Actions Build / Test / Security Container Image Amazon ECR GitOps Repository ArgoCD Amazon EKS Responsabilidades: * construção de pipelines CI/CD; * criação de workflows reutilizáveis; * gerenciamento de secrets; * integração com ECR; * deployment GitOps; * estratégias de rollback; * promoção entre ambientes; * controle de versões; * políticas de aprovação. Desejável conhecimento de: * Argo Rollouts; * Blue/Green Deployment; * Canary Deployment; * Progressive Delivery. **5\. Observabilidade da Plataforma** ===================================== Responsável por implementar observabilidade completa dos workloads. Stack principal: **OpenTelemetry \+ Datadog** A plataforma deverá coletar: * Metrics * Logs * Traces * Events O OpenTelemetry deverá ser utilizado como camada de instrumentação e coleta independente de fornecedor. Arquitetura esperada: Applications AI Services AI Agents Kubernetes OpenTelemetry SDK OpenTelemetry Collector Datadog Responsabilidades: * instrumentação OpenTelemetry; * administração de OpenTelemetry Collectors; * distributed tracing; * dashboards; * alertas; * correlação entre logs, métricas e traces; * definição de SLIs e SLOs; * monitoração de disponibilidade; * monitoração de performance; * análise de incidentes; * troubleshooting distribuído. **6\. AI Observability / LLM Observability** ============================================ Um dos diferenciais da posição será operar a camada de observabilidade específica para Inteligência Artificial. Além da observabilidade tradicional, deverão ser acompanhados indicadores como: * Latência de inferência. * Time to First Tok