Descrição da vaga
Buscamos um profissional Sênior com perfil híbrido, capaz de transitar entre o desenvolvimento de modelos (MLE) e a engenharia de plataforma/infraestrutura (MLOps). Nosso time cuida de todo o ciclo de vida dos modelos, desde a concepção até a sustentação em produção. Aqui, você trabalhará diretamente com sistemas distribuídos, desenhará arquiteturas escalonáveis, gerenciará infraestrutura em nuvem e apoiará o time na criação de ferramentas auxiliares. É um ambiente com alto grau de autonomia técnica e espaço para inovação (incluindo o início de novos projetos com LLMs).
Responsabilidades e atribuições
-
Projetar, construir e manter sistemas complexos e distribuídos para o ciclo de vida completo de Machine Learning (da ingestão ao monitoramento em produção);
-
Implementar e evoluir nossa arquitetura de MLOps, incluindo conceitos de Feature Store, Model Serving e pipelines de CI/CD automatizados;
-
Gerenciar e aplicar a infraestrutura em nuvem para os projetos do time utilizando práticas de Infraestrutura como Código (IaC);
-
Desenvolver ferramentas auxiliares e frameworks internos para otimizar os fluxos de trabalho do time;
-
Garantir a aplicação das melhores práticas de desenvolvimento de software (testes, código limpo, arquitetura sustentável);
-
Atuar em parceria com áreas de negócio (Produtos, Sucesso do Cliente e Vendas/Marketing) para traduzir necessidades comerciais em soluções técnicas viáveis.
Requisitos e qualificações
-
Sólida experiência como Engenheiro de Machine Learning (MLE) ou MLOps em ambientes de produção;
-
Conhecimento obrigatório em Sistemas Distribuídos e arquiteturas escalonáveis;
-
Domínio avançado da linguagem Python e boas práticas de engenharia de software;
-
Experiência prática com ferramentas de processamento massivo ou paralelo, como Spark e/ou Dask;
-
Experiência com computação em nuvem (Stack principal: AWS, mas conhecimentos em GCP ou Azure são totalmente aceitos);
-
Conhecimento prático em gerenciamento de infraestrutura utilizando Terraform;
-
Experiência com containerização (Docker);
-
Vivência com o ciclo de vida e deploy de modelos tradicionais (Regressão e Classificação).
Desejáveis:
-
Conhecimento prático em Kubernetes (K8s);
-
Experiência com mensageria/streaming (Kafka) e padrões de processamento assíncrono;
-
Conhecimento em ferramentas de orquestração de fluxos, preferencialmente Prefect (Airflow, Kubeflow ou similares também são válidos);
-
Entusiasmo ou experiência inicial em colocar LLMs / GenAI em produção;
-
Conhecimento em outras linguagens para manutenção de sistemas ou otimização de performance/fluxo de dados (como Java, Rust, C/C++ ou computação em GPUs);
-
Inglês avançado (leitura, escrita e documentação técnica).