AI Jobs Map

SRM ASSET · São Paulo, São Paulo, Brazil

SRE Pleno

full timePosted 7 days ago
Apply on LinkedInLinkedInOpens the original posting. AI Jobs Map never asks for your details.

Stack mentioned

sreawskubernetesdatadogec2s3identity-and-access-managementci/cdlinuxdockergitbashpythonterraform

Site Reliability Engineer (SRE) Pleno

Objetivo da posição

Atuar na sustentação, administração, observabilidade e evolução dos ambientes de infraestrutura e aplicações, garantindo disponibilidade, estabilidade, segurança e desempenho dos serviços.

O profissional será responsável principalmente pela administração dos ambientes AWS, Kubernetes, soluções de backup Veeam/AWS e observabilidade através do Datadog, atuando também na análise e resolução de incidentes.

Principais responsabilidades

Administração de Recursos AWS

- Administrar e acompanhar recursos e serviços hospedados na AWS.

- Realizar troubleshooting de infraestrutura, conectividade, disponibilidade e performance.

- Acompanhar utilização e capacidade dos recursos.

- Apoiar provisionamento, configuração e manutenção dos ambientes.

- Administrar recursos como EC2, EBS, S3, IAM, VPC, Load Balancers, Route 53 e demais serviços utilizados pela organização.

- Analisar eventos, logs e métricas através de CloudWatch e CloudTrail.

- Apoiar aplicação de boas práticas de segurança, disponibilidade e controle de acesso.

- Participar da análise e otimização de custos e recursos AWS.

- Apoiar processos de atualização, manutenção e mudanças de infraestrutura.

Administração de Backup Veeam e AWS

- Administrar e monitorar rotinas de backup através do Veeam e serviços AWS.

- Acompanhar execução, sucesso e falhas dos jobs de backup.

- Investigar e corrigir falhas relacionadas às rotinas de backup.

- Executar e acompanhar procedimentos de restore quando necessário.

- Realizar testes periódicos de recuperação para garantir a integridade dos backups.

- Apoiar políticas de retenção, armazenamento e ciclo de vida dos backups.

- Acompanhar capacidade e utilização dos repositórios de backup.

- Apoiar procedimentos relacionados a Disaster Recovery e continuidade de negócio.

- Manter documentação e evidências das rotinas e testes de recuperação.

Administração de Clusters Kubernetes

- Administrar e monitorar clusters Kubernetes.

- Acompanhar Pods, Deployments, StatefulSets, DaemonSets, Services, Ingress, ConfigMaps e Secrets.

- Realizar troubleshooting de aplicações e workloads executados nos clusters.

- Analisar eventos, logs, probes, consumo de CPU/memória e comportamento dos Pods.

- Investigar problemas como CrashLoopBackOff, ImagePullBackOff, OOMKilled, falhas de probes e indisponibilidade de aplicações.

- Apoiar atualização e manutenção dos clusters e seus componentes.

- Administrar namespaces, permissões e recursos dos ambientes.

- Apoiar configurações de escalabilidade, requests, limits e autoscaling.

- Trabalhar em conjunto com os times de desenvolvimento na análise de problemas das aplicações.

- Apoiar processos de deploy e operação de aplicações utilizando práticas de CI/CD e GitOps.

Administração de Observabilidade e Datadog

- Administrar e manter dashboards no Datadog.

- Criar e evoluir dashboards técnicos e operacionais.

- Criar e ajustar monitors e alertas.

- Acompanhar métricas de infraestrutura e aplicações.

- Realizar análise de logs, métricas e traces para troubleshooting.

- Utilizar recursos de APM para identificação de gargalos e falhas de aplicações.

- Acompanhar indicadores de disponibilidade, latência, erros e saturação.

- Apoiar definição e acompanhamento de SLIs e SLOs.

- Revisar alertas buscando redução de falsos positivos e melhoria da qualidade da monitoração.

- Apoiar times técnicos durante incidentes utilizando dados de observabilidade para identificação da causa raiz.

Atuação operacional

O profissional também deverá:

- Atuar no atendimento e resolução de incidentes de infraestrutura e aplicações.

- Realizar troubleshooting de problemas de média complexidade.

- Participar de análises de causa raiz (RCA).

- Registrar procedimentos, incidentes e soluções em documentação técnica.

- Executar mudanças seguindo os processos internos de Change Management.

- Trabalhar em conjunto com os times de SRE, Infraestrutura, Redes, Segurança, Banco de Dados e Desenvolvimento.

- Apoiar automações para redução de atividades operacionais manuais.

- Participar da evolução contínua dos ambientes e processos de confiabilidade.

Conhecimentos técnicos desejados

- AWS.

- Kubernetes.

- Veeam Backup & Replication.

- Datadog.

- Linux.

- Redes TCP/IP, DNS, HTTP/HTTPS e troubleshooting de conectividade.

- Conceitos de containers e Docker.

- Git.

- CI/CD.

- Shell Script e/ou Python.

- Terraform ou outra ferramenta de Infrastructure as Code.

- Conceitos de observabilidade: métricas, logs e traces.

- Conceitos de alta disponibilidade, backup e Disaster Recovery.

- Conhecimentos básicos de segurança em ambientes Cloud.

Perfil esperado

Buscamos um profissional de nível pleno, com autonomia para executar atividades operacionais e troubleshooting de média complexidade, capacidade de análise de incidentes e interesse em automação e melhoria contínua.

É importante possuir boa comunicação, organização, senso de responsabilidade sobre ambientes produtivos e capacidade de trabalhar de forma integrada com diferentes times técnicos.

More jobs at SRM ASSET