Sobre a posição
Buscamos uma pessoa engenheira de plataforma com experiência prática em Kubernetes, Terraform, Docker e ambientes de nuvem, especialmente Azure e GCP.
Na Datlo, você atuará na sustentação e evolução da plataforma que atende os times de Desenvolvimento e Dados, contribuindo para tornar a entrega de software mais segura, confiável, observável e eficiente.
Esperamos alguém capaz de investigar problemas, implementar automações e conduzir demandas de média complexidade com autonomia. Decisões de maior impacto serão construídas em conjunto com profissionais mais experientes e com os times envolvidos.
Principais responsabilidades
- Sustentar e evoluir clusters Kubernetes e os serviços que compõem a plataforma.
- Criar e manter infraestrutura como código utilizando Terraform.
- Construir e evoluir pipelines de integração, entrega e implantação contínuas.
- Automatizar atividades operacionais, reduzindo tarefas manuais, riscos e inconsistências entre ambientes.
- Apoiar a criação, configuração e evolução de ambientes de desenvolvimento, homologação e produção.
- Manter e evoluir componentes compartilhados de infraestrutura utilizados pelos times de Desenvolvimento e Dados.
- Investigar falhas de infraestrutura, rede, DNS, aplicações conteinerizadas, pipelines e serviços em nuvem.
- Atuar na resolução de incidentes, contribuindo para análises de causa e ações preventivas.
- Implementar e evoluir práticas de observabilidade por meio de logs, métricas, alertas e tracing.
- Apoiar os times na definição de recursos, configurações, health checks, estratégias de deploy e requisitos de disponibilidade.
- Contribuir para práticas de segurança, gestão de identidades, permissões, certificados e segredos.
- Monitorar utilização de recursos e contribuir para decisões relacionadas a desempenho, escalabilidade e custos de infraestrutura.
- Participar de discussões sobre arquitetura, confiabilidade, segurança, operação e evolução da plataforma.
- Documentar decisões, procedimentos e soluções técnicas de forma clara e reutilizável.
- Compartilhar conhecimento e apoiar os times no uso adequado da plataforma.
O que buscamos
- Experiência prática com sustentação e evolução de ambientes de infraestrutura ou plataforma.
- Experiência com Kubernetes, incluindo deploys, services, ingress ou Gateway API, configuração de recursos, probes, autoscaling e troubleshooting.
- Experiência com Terraform para provisionamento e manutenção de infraestrutura como código.
- Conhecimento sólido de Docker, construção de imagens, boas práticas de segurança e execução de aplicações conteinerizadas.
- Experiência com pelo menos um provedor de nuvem, preferencialmente Microsoft Azure.
- Conhecimento de pipelines de CI/CD e automação de processos de build, testes e deploy.
- Conhecimento de redes, DNS, balanceamento de carga, certificados TLS e comunicação entre serviços.
- Experiência com monitoramento, logs, métricas e alertas.
- Conhecimento de Linux e capacidade de investigar problemas utilizando linha de comando.
- Experiência com Git e fluxo de revisão de código.
- Capacidade de investigar problemas técnicos de forma estruturada, considerando aplicação, infraestrutura e serviços externos.
- Capacidade de atuar com autonomia em demandas de média complexidade e pedir apoio diante de decisões críticas ou de alto impacto.
Experiência com Kubernetes e contêineres
A plataforma da Datlo utiliza Kubernetes como parte central da execução e da disponibilização dos serviços. Por isso, esperamos experiência prática, não apenas conhecimento conceitual.
É importante conseguir:
- Compreender e ajustar manifests e recursos Kubernetes;
- Investigar falhas de agendamento, inicialização, comunicação e disponibilidade de workloads;
- Analisar consumo, requests e limits de CPU e memória;
- Configurar probes, secrets, ConfigMaps e políticas de atualização;
- Investigar problemas de rede, DNS, ingress e comunicação entre serviços;
- Utilizar Helm ou ferramentas equivalentes para empacotamento e configuração;
- Analisar logs, eventos e métricas para identificar causas de falhas;
- Compreender estratégias de deploy, rollback, escalabilidade e alta disponibilidade;
- Construir e otimizar imagens Docker adequadas para ambientes de produção.
Não esperamos que a pessoa já tenha projetado sozinha uma plataforma Kubernetes completa, mas ela deve conseguir operar o ambiente, implementar evoluções e conduzir troubleshooting com autonomia compatível com o nível Pleno.
Experiência com infraestrutura como código e cloud
Esperamos experiência com Terraform e compreensão dos princípios de infraestrutura como código, incluindo:
- Criação e manutenção de módulos;
- Organização e reutilização de configurações;
- Oerenciamento seguro de state;
- Revisão de planos antes da aplicação;
- Separação e padronização de ambientes;
- Tratamento de variáveis, outputs e dependências;
- Prevenção de alterações manuais que causem divergência entre o código e a infraestrutura;
- Uso de pipelines para validação e aplicação de mudanças.
Em cloud, buscamos experiência com Azure ou GCP. Não é obrigatório dominar os dois provedores, mas é importante ter boa base em serviços gerenciados, identidade, redes, storage, bancos de dados, Kubernetes e monitoramento.
Observabilidade e confiabilidade
Esperamos que a pessoa compreenda observabilidade como parte da entrega e da operação dos serviços, e não apenas como uma ferramenta de monitoramento.
É importante conseguir:
- Estruturar e consultar logs;
- Criar métricas e alertas úteis;
- Acompanhar disponibilidade, latência, erros e consumo de recursos;
- Construir dashboards que ajudem na identificação de problemas;
- Reduzir alertas sem ação ou contexto;
- Apoiar investigações e análises de causa;
- Propor melhorias que evitem a repetição de incidentes;
- Contribuir progressivamente para a definição de indicadores e objetivos de confiabilidade.
Segurança e operação
A pessoa deverá contribuir para que os ambientes sejam seguros e operáveis, participando de temas como:
- Gestão de identidades e acessos;
- Aplicação do princípio do menor privilégio;
- Armazenamento e distribuição segura de segredos;
- Gestão e renovação de certificados;
- Atualização de imagens e componentes;
- Análise e correção de vulnerabilidades;
- Segregação entre ambientes;
- Definição de procedimentos de backup e recuperação;
- Documentação de rotinas e respostas a incidentes.
Não esperamos que seja especialista em segurança, mas é necessário reconhecer riscos básicos e evitar que velocidade operacional comprometa a proteção dos ambientes.
Diferenciais
- Experiência com Azure Kubernetes Service - AKS.
- Experiência com Google Kubernetes Engine - GKE.
- Conhecimento de Azure DevOps ou GitHub Actions.
- Experiência com Helm, Kustomize ou ferramentas equivalentes.
- Conhecimento de GitOps e ferramentas como Argo CD ou Flux.
- Experiência com Prometheus, Grafana, OpenTelemetry ou ferramentas equivalentes.
- Conhecimento de Azure Monitor, Log Analytics ou Google Cloud Monitoring.
- Experiência com Gateway API, ingress controllers, service mesh ou API gateways.
- Conhecimento de Azure Service Bus, Pub/Sub, Kafka ou outras tecnologias de mensageria.
- Experiência com External Secrets Operator, Azure Key Vault ou Google Secret Manager.
- Conhecimento de Workload Identity e autenticação entre workloads e serviços em nuvem.
- Experiência com PostgreSQL, Redis, storage e outros serviços gerenciados.
- Conhecimento de FinOps e otimização de custos em cloud.
- Experiência apoiando plataformas utilizadas por times de Engenharia de Dados.
- Conhecimento de Python, Bash ou outra linguagem aplicada à automação.
- Certificações Azure, GCP, Kubernetes ou Terraform.
Visão comportamental
- Investiga a causa do problema em vez de apenas contornar o sintoma.
- Automatiza atividades recorrentes sempre que o ganho justificar o investimento.
- Busca criar soluções reutilizáveis, evitando configurações específicas para cada caso.
- Avalia riscos antes de realizar mudanças em ambientes críticos.
- Comunica incidentes, riscos e dependências com clareza e rapidez.
- Registra decisões e procedimentos para reduzir a dependência de conhecimento individual.
- Equilibra confiabilidade, segurança, custo e velocidade de entrega.
- Trabalha de forma próxima aos times de Desenvolvimento e Dados.
- Sabe quando pode decidir com autonomia e quando uma mudança exige alinhamento.
- Assume erros, compartilha aprendizados e contribui para evitar recorrências.
- Atua de acordo com os princípios e comportamentos definidos no Manifesto da Datlo.
Formação
Graduação em Engenharia de Software, Ciência da Computação, Sistemas de Informação, Redes, áreas de exatas ou tecnologia é desejável, com ao menos 2 anos de experiência na área.
Certificações de Azure, GCP, Kubernetes ou Terraform não são obrigatórias, mas serão consideradas diferenciais.
O que esperamos nos primeiros meses
- Compreender a arquitetura da plataforma, os ambientes e os principais serviços utilizados pela Datlo.
- Conhecer o fluxo de desenvolvimento, os pipelines e a forma como os times publicam e operam seus serviços.
- Entender as principais dependências entre plataforma, aplicações e pipelines de dados.
- Assumir progressivamente demandas de sustentação e evolução de média complexidade.
- Contribuir para investigações, automações, documentação e melhorias operacionais.
- Identificar riscos, tarefas manuais e pontos de fragilidade que possam ser reduzidos.
- Construir uma relação de confiança com os times de Desenvolvimento, Dados e demais áreas atendidas pela plataforma.
O que você encontrará na Datlo
Um ambiente em que a Plataforma trabalha diretamente com os times de Desenvolvimento e Dados para construir uma base tecnológica confiável, segura e escalável.
Você terá espaço para atuar em problemas reais de cloud, Kubernetes, automação, observabilidade e infraestrutura como código, ampliando progressivamente sua autonomia e participação nas decisões técnicas da plataforma.