AI Jobs Map

Datlo · Maringá, Paraná, Brazil

Engenheiro(a) de Plataforma Pleno - DevOps/Cloud

entry_levelfull timePosted yesterday
Apply on LinkedInLinkedInOpens the original posting. AI Jobs Map never asks for your details.

Stack mentioned

devopskubernetesterraformdockerazuregcpci/cdlinuxgithelmgithubargocdprometheusgrafanaopentelemetryapache-kafkapostgresqlredispythonbash

Sobre a posição
Buscamos uma pessoa engenheira de plataforma com experiência prática em Kubernetes, Terraform, Docker e ambientes de nuvem, especialmente Azure e GCP.

Na Datlo, você atuará na sustentação e evolução da plataforma que atende os times de Desenvolvimento e Dados, contribuindo para tornar a entrega de software mais segura, confiável, observável e eficiente.

Esperamos alguém capaz de investigar problemas, implementar automações e conduzir demandas de média complexidade com autonomia. Decisões de maior impacto serão construídas em conjunto com profissionais mais experientes e com os times envolvidos.
Principais responsabilidades

- Sustentar e evoluir clusters Kubernetes e os serviços que compõem a plataforma.

- Criar e manter infraestrutura como código utilizando Terraform.

- Construir e evoluir pipelines de integração, entrega e implantação contínuas.

- Automatizar atividades operacionais, reduzindo tarefas manuais, riscos e inconsistências entre ambientes.

- Apoiar a criação, configuração e evolução de ambientes de desenvolvimento, homologação e produção.

- Manter e evoluir componentes compartilhados de infraestrutura utilizados pelos times de Desenvolvimento e Dados.

- Investigar falhas de infraestrutura, rede, DNS, aplicações conteinerizadas, pipelines e serviços em nuvem.

- Atuar na resolução de incidentes, contribuindo para análises de causa e ações preventivas.

- Implementar e evoluir práticas de observabilidade por meio de logs, métricas, alertas e tracing.

- Apoiar os times na definição de recursos, configurações, health checks, estratégias de deploy e requisitos de disponibilidade.

- Contribuir para práticas de segurança, gestão de identidades, permissões, certificados e segredos.

- Monitorar utilização de recursos e contribuir para decisões relacionadas a desempenho, escalabilidade e custos de infraestrutura.

- Participar de discussões sobre arquitetura, confiabilidade, segurança, operação e evolução da plataforma.

- Documentar decisões, procedimentos e soluções técnicas de forma clara e reutilizável.

- Compartilhar conhecimento e apoiar os times no uso adequado da plataforma.

O que buscamos

- Experiência prática com sustentação e evolução de ambientes de infraestrutura ou plataforma.

- Experiência com Kubernetes, incluindo deploys, services, ingress ou Gateway API, configuração de recursos, probes, autoscaling e troubleshooting.

- Experiência com Terraform para provisionamento e manutenção de infraestrutura como código.

- Conhecimento sólido de Docker, construção de imagens, boas práticas de segurança e execução de aplicações conteinerizadas.

- Experiência com pelo menos um provedor de nuvem, preferencialmente Microsoft Azure.

- Conhecimento de pipelines de CI/CD e automação de processos de build, testes e deploy.

- Conhecimento de redes, DNS, balanceamento de carga, certificados TLS e comunicação entre serviços.

- Experiência com monitoramento, logs, métricas e alertas.

- Conhecimento de Linux e capacidade de investigar problemas utilizando linha de comando.

- Experiência com Git e fluxo de revisão de código.

- Capacidade de investigar problemas técnicos de forma estruturada, considerando aplicação, infraestrutura e serviços externos.

- Capacidade de atuar com autonomia em demandas de média complexidade e pedir apoio diante de decisões críticas ou de alto impacto.

Experiência com Kubernetes e contêineres
A plataforma da Datlo utiliza Kubernetes como parte central da execução e da disponibilização dos serviços. Por isso, esperamos experiência prática, não apenas conhecimento conceitual.

É importante conseguir:

- Compreender e ajustar manifests e recursos Kubernetes;

- Investigar falhas de agendamento, inicialização, comunicação e disponibilidade de workloads;

- Analisar consumo, requests e limits de CPU e memória;

- Configurar probes, secrets, ConfigMaps e políticas de atualização;

- Investigar problemas de rede, DNS, ingress e comunicação entre serviços;

- Utilizar Helm ou ferramentas equivalentes para empacotamento e configuração;

- Analisar logs, eventos e métricas para identificar causas de falhas;

- Compreender estratégias de deploy, rollback, escalabilidade e alta disponibilidade;

- Construir e otimizar imagens Docker adequadas para ambientes de produção.

Não esperamos que a pessoa já tenha projetado sozinha uma plataforma Kubernetes completa, mas ela deve conseguir operar o ambiente, implementar evoluções e conduzir troubleshooting com autonomia compatível com o nível Pleno.
Experiência com infraestrutura como código e cloud
Esperamos experiência com Terraform e compreensão dos princípios de infraestrutura como código, incluindo:

- Criação e manutenção de módulos;

- Organização e reutilização de configurações;

- Oerenciamento seguro de state;

- Revisão de planos antes da aplicação;

- Separação e padronização de ambientes;

- Tratamento de variáveis, outputs e dependências;

- Prevenção de alterações manuais que causem divergência entre o código e a infraestrutura;

- Uso de pipelines para validação e aplicação de mudanças.

Em cloud, buscamos experiência com Azure ou GCP. Não é obrigatório dominar os dois provedores, mas é importante ter boa base em serviços gerenciados, identidade, redes, storage, bancos de dados, Kubernetes e monitoramento.
Observabilidade e confiabilidade
Esperamos que a pessoa compreenda observabilidade como parte da entrega e da operação dos serviços, e não apenas como uma ferramenta de monitoramento.

É importante conseguir:

- Estruturar e consultar logs;

- Criar métricas e alertas úteis;

- Acompanhar disponibilidade, latência, erros e consumo de recursos;

- Construir dashboards que ajudem na identificação de problemas;

- Reduzir alertas sem ação ou contexto;

- Apoiar investigações e análises de causa;

- Propor melhorias que evitem a repetição de incidentes;

- Contribuir progressivamente para a definição de indicadores e objetivos de confiabilidade.

Segurança e operação
A pessoa deverá contribuir para que os ambientes sejam seguros e operáveis, participando de temas como:

- Gestão de identidades e acessos;

- Aplicação do princípio do menor privilégio;

- Armazenamento e distribuição segura de segredos;

- Gestão e renovação de certificados;

- Atualização de imagens e componentes;

- Análise e correção de vulnerabilidades;

- Segregação entre ambientes;

- Definição de procedimentos de backup e recuperação;

- Documentação de rotinas e respostas a incidentes.

Não esperamos que seja especialista em segurança, mas é necessário reconhecer riscos básicos e evitar que velocidade operacional comprometa a proteção dos ambientes.
Diferenciais

- Experiência com Azure Kubernetes Service - AKS.

- Experiência com Google Kubernetes Engine - GKE.

- Conhecimento de Azure DevOps ou GitHub Actions.

- Experiência com Helm, Kustomize ou ferramentas equivalentes.

- Conhecimento de GitOps e ferramentas como Argo CD ou Flux.

- Experiência com Prometheus, Grafana, OpenTelemetry ou ferramentas equivalentes.

- Conhecimento de Azure Monitor, Log Analytics ou Google Cloud Monitoring.

- Experiência com Gateway API, ingress controllers, service mesh ou API gateways.

- Conhecimento de Azure Service Bus, Pub/Sub, Kafka ou outras tecnologias de mensageria.

- Experiência com External Secrets Operator, Azure Key Vault ou Google Secret Manager.

- Conhecimento de Workload Identity e autenticação entre workloads e serviços em nuvem.

- Experiência com PostgreSQL, Redis, storage e outros serviços gerenciados.

- Conhecimento de FinOps e otimização de custos em cloud.

- Experiência apoiando plataformas utilizadas por times de Engenharia de Dados.

- Conhecimento de Python, Bash ou outra linguagem aplicada à automação.

- Certificações Azure, GCP, Kubernetes ou Terraform.

Visão comportamental

- Investiga a causa do problema em vez de apenas contornar o sintoma.

- Automatiza atividades recorrentes sempre que o ganho justificar o investimento.

- Busca criar soluções reutilizáveis, evitando configurações específicas para cada caso.

- Avalia riscos antes de realizar mudanças em ambientes críticos.

- Comunica incidentes, riscos e dependências com clareza e rapidez.

- Registra decisões e procedimentos para reduzir a dependência de conhecimento individual.

- Equilibra confiabilidade, segurança, custo e velocidade de entrega.

- Trabalha de forma próxima aos times de Desenvolvimento e Dados.

- Sabe quando pode decidir com autonomia e quando uma mudança exige alinhamento.

- Assume erros, compartilha aprendizados e contribui para evitar recorrências.

- Atua de acordo com os princípios e comportamentos definidos no Manifesto da Datlo.

Formação
Graduação em Engenharia de Software, Ciência da Computação, Sistemas de Informação, Redes, áreas de exatas ou tecnologia é desejável, com ao menos 2 anos de experiência na área.

Certificações de Azure, GCP, Kubernetes ou Terraform não são obrigatórias, mas serão consideradas diferenciais.
O que esperamos nos primeiros meses

- Compreender a arquitetura da plataforma, os ambientes e os principais serviços utilizados pela Datlo.

- Conhecer o fluxo de desenvolvimento, os pipelines e a forma como os times publicam e operam seus serviços.

- Entender as principais dependências entre plataforma, aplicações e pipelines de dados.

- Assumir progressivamente demandas de sustentação e evolução de média complexidade.

- Contribuir para investigações, automações, documentação e melhorias operacionais.

- Identificar riscos, tarefas manuais e pontos de fragilidade que possam ser reduzidos.

- Construir uma relação de confiança com os times de Desenvolvimento, Dados e demais áreas atendidas pela plataforma.

O que você encontrará na Datlo
Um ambiente em que a Plataforma trabalha diretamente com os times de Desenvolvimento e Dados para construir uma base tecnológica confiável, segura e escalável.

Você terá espaço para atuar em problemas reais de cloud, Kubernetes, automação, observabilidade e infraestrutura como código, ampliando progressivamente sua autonomia e participação nas decisões técnicas da plataforma.

More jobs at Datlo