Analista DevOps Pleno

NSTECH · Remoto, BR

A nstech é a mais completa plataforma open logistics do mundo, construindo o futuro digital do transporte de cargas junto a todo o ecossistema logístico. Nosso objetivo é conectar e transformar a cadeia logística, oferecendo centenas de soluções integradas em um único lugar. Acreditamos no poder da tecnologia para melhorar o mundo, reduzindo a emissão de CO2, acidentes e roubos. **Sobre a Vaga** Esta é uma oportunidade para um(a) **Analista DevOps Pleno** com perfil focado em **Cloud Operations e Engenharia de Confiabilidade (SRE)**. Você será a referência técnica para garantir a estabilidade, escalabilidade e resiliência do nosso ecossistema cloud\-native baseado em **Kubernetes**. Sua missão será **contribuir com a padronização das esteiras de CI/CD, garantir a governança da infraestrutura através de IaC (Infrastructure as Code)** e capitanear a estratégia de observabilidade de ponta a ponta. Buscamos alguém que use a automação avançada para reduzir o MTTR e implementar mecanismos de auto\-reparação (*self\-healing*), transformando a eficiência da nossa operação de logística e mobilidade. **Responsabilidades:** * Definir, padronizar e evoluir o modelo de CI/CD da companhia, garantindo esteiras de deploy rápidas, seguras, automatizadas e com validações de segurança integradas (DevSecOps). * Arquitetar e gerenciar a infraestrutura global via IaC (Infrastructure as Code), garantindo a reprodutibilidade dos ambientes, controle de versão e aplicando práticas recomendadas de mercado. * Evoluir a estratégia de observabilidade utilizando a plataforma Datadog como ferramenta central (do frontend ao banco de dados). * Definir e implementar SLIs, SLOs e Error Budgets junto aos times de produto para garantir a saúde do negócio e das aplicações críticas. * Arquitetar alertas inteligentes e preditivos, explorando capacidades de AIOps para antecipar falhas antes que impactem o cliente final. * Disseminar a cultura de SRE e DevOps, apoiando desenvolvedores na análise de traces distribuídos, gargalos de performance e adoção dos padrões de deploy e infraestrutura. * Liderar a resposta a incidentes críticos como *Incident Commander*, coordenando *war rooms* e facilitando a comunicação entre times técnicos e de negócio. * Combater o trabalho manual (*toil*), priorizando a automação de runbooks e diagnósticos para redução drástica do MTTR. * Facilitar análises de causa raiz (RCA) com foco em melhoria contínua (*blameless post\-mortems*), garantindo que incidentes gerem evolução na plataforma. * Desenhar mecanismos complexos de auto\-reparação, como parametrização avançada de liveness/readiness probes, HPA/VPA e resiliência de microsserviços. * Desenvolver ferramentas e scripts (Python, Go, ou Shell)para automatizar a remediação de incidentes e tarefas operacionais. * Colaborar com a equipe de Engenharia de Infraestrutura para evoluir a plataforma de Cloud, garantindo que as fundações de rede, segurança e computação estejam alinhadas com as necessidades de CI/CD e IaC. **Requisitos Técnicos** * Experiência com Kubernetes (conceitos de Pods, Services, Deployments, Ingress) e Docker * Experiência prática com ferramentas de APM como Datadog, Dynatrace ou New Relic * Conhecimento em pelo menos uma nuvem principal (Azure ou AWS) * Habilidade comprovada em análise de logs, métricas e troubleshooting de aplicações web * Noções de Shell Script, Python ou PowerShell para automação de tarefas * Experiência com Helm para gerenciamento de pacotes Kubernetes * Conhecimento em Prometheus e Grafana * Familiaridade com pipelines de CI/CD (Azure DevOps, GitHub Actions, Jenkins) * Conhecimento conceitual de Infraestrutura como Código (Terraform) * Exposição a conceitos de Service Mesh (Istio, Linkerd) **Desejáveis:** * CKA (Certified Kubernetes Administrator) * Certificações APM (Datadog, Dynatrace, NewRelic) * Certificações de Cloud (Azure, AWS) * Certificações de Automação (Terraform, Ansible) **Perfil:** * Mentalidade SRE: Foco incansável em disponibilidade, performance e resiliência. * Resolvedor de Problemas (Investigador): Paixão por investigar problemas complexos até a causa raiz, como um detetive. * Calma sob Pressão: Habilidade de manter o foco e a clareza de raciocínio durante incidentes críticos. * Colaboração: Capacidade de trabalhar de forma integrada com desenvolvedores, infraestrutura e SREs. * Ownership (Senso de Dono): Sentir\-se responsável pelo sucesso e pela estabilidade das aplicações em produção.