Sobre a posição
Buscamos uma pessoa engenheira de dados com experiência em SQL, Python, modelagem analítica e construção de pipelines, além de conhecimento prático na aplicação de inteligência artificial generativa e modelos de linguagem.
Na Datlo, você será responsável por transformar dados brutos em ativos confiáveis, documentados e acessíveis para produtos, análises e decisões de negócio. Também participará da construção e da operação de soluções baseadas em LLMs, prompts, embeddings, recuperação de informações e automações com IA.
Esperamos alguém capaz de conduzir demandas de média complexidade com autonomia, compreender o contexto de negócio por trás dos dados e avaliar criticamente as soluções entregues. Decisões de maior impacto arquitetural, financeiro ou organizacional serão construídas em conjunto com profissionais mais experientes e com os times envolvidos.
Principais responsabilidades
- Construir, manter e evoluir pipelines de ingestão, transformação e disponibilização de dados provenientes de bancos, APIs, arquivos e serviços externos.
- Desenvolver transformações e modelos analíticos utilizando SQL e Python.
- Organizar os dados em camadas com padrões consistentes de nomenclatura, qualidade, documentação e rastreabilidade.
- Definir estratégias de carga incremental e completa, tratando idempotência, duplicidade, dependências e recuperação de falhas.
- Orquestrar e monitorar pipelines, incluindo reprocessamentos, concorrência, alertas e tratamento de falhas.
- Implementar testes e validações de integridade, completude, unicidade, atualidade e consistência.
- Investigar problemas de qualidade, desempenho, custo e disponibilidade, propondo melhorias estruturais sempre que necessário.
- Otimizar consultas, processamento e armazenamento de dados em ambientes de nuvem.
- Compreender regras de negócio e transformá-las em modelos de dados, métricas e componentes reutilizáveis.
- Preparar e disponibilizar dados para produtos analíticos e soluções de inteligência artificial.
- Desenvolver provas de conceito e aplicações que utilizem LLMs, prompts, embeddings e recuperação de informações.
- Participar do deploy, monitoramento e evolução de serviços e automações baseados em IA.
- Avaliar a qualidade, segurança, latência, custo e confiabilidade das soluções com LLMs utilizando critérios objetivos.
- Colaborar com Desenvolvimento, Plataforma, Produto e áreas de negócio para garantir que as entregas sejam tecnicamente sustentáveis e gerem valor.
- Documentar datasets, pipelines, métricas, prompts, regras de negócio e decisões técnicas.
- Utilizar ferramentas de IA generativa de maneira crítica para apoiar desenvolvimento, investigação, documentação e exploração de dados, sempre validando os resultados produzidos.
- Noções de embeddings, busca semântica e fundamentos de RAG;
- Monitoramento de custo, latência, consumo, erros e qualidade;
- Proteção de informações sensíveis e credenciais sob sua responsabilidade;
O que buscamos
- Experiência prévia em Engenharia de Dados, Analytics Engineering ou funções relacionadas.
- Domínio sólido de SQL aplicado à transformação, modelagem e análise de dados.
- Experiência com Python para processamento de dados, automações, integrações e construção de pipelines.
- Experiência com data warehouses em nuvem, preferencialmente BigQuery.
- Conhecimento de modelagem de dados analíticos e organização dos dados em camadas.
- Experiência com dbt ou ferramenta equivalente de transformação de dados.
- Experiência com Prefect, Airflow ou outra ferramenta de orquestração.
- Conhecimento de Git, revisão de código e processos de CI/CD.
- Experiência com testes, validações, monitoramento e práticas de qualidade de dados.
- Conhecimento prático de APIs de modelos de linguagem, engenharia de prompts, embeddings e fundamentos de RAG.
- Capacidade de conduzir demandas de média complexidade desde o entendimento do problema até a entrega, documentação e monitoramento da solução.
- Capacidade de traduzir necessidades de negócio em soluções de dados claras, confiáveis e reutilizáveis.
Não esperamos que a pessoa tenha projetado sozinha toda a arquitetura de uma plataforma de dados ou colocado uma plataforma de IA em produção em larga escala. Entretanto, ela deverá conseguir manter e evoluir pipelines, modelos e aplicações de média complexidade com a autonomia esperada para a senioridade. Esperamos que a pessoa compreenda como integrar modelos de linguagem aos dados, sistemas e processos da empresa.
Diferenciais
- Experiência com Prefect.
- Experiência com BigQuery e Google Cloud Platform.
- Experiência com desenvolvimento de APIs.
- Noções de Docker e deploy.
- Experiência com frameworks para aplicações baseadas em LLMs.
- Conhecimento de function calling, tool calling, agentes ou fluxos automatizados com IA.
- Experiência com ferramentas de avaliação e observabilidade de aplicações com LLMs.
- Noções de machine learning, incluindo treinamento, validação e disponibilização de modelos.
- Conhecimento de estatística aplicada, experimentação e avaliação de modelos.
- Familiaridade com scikit-learn, MLflow ou ferramentas equivalentes.
- Experiência com análise espacial, dados geográficos ou inteligência de mercado.
- Noções de Kubernetes.
- Vivência em consultoria, projetos para clientes ou ambientes com diferentes contextos de negócio.
Visão comportamental
- Compreende o problema de negócio antes de construir o pipeline, o modelo de dados ou a solução de IA.
- Verifica se o que entrega é confiável, compreensível e útil para quem irá consumir.
- Investiga causas em vez de apenas corrigir sintomas.
- Comunica riscos, dependências e problemas de qualidade com clareza.
- Questiona requisitos quando identifica inconsistências, riscos ou alternativas melhores.
- Transforma demandas abertas em escopos técnicos claros, alinhando expectativas, restrições e critérios de sucesso.
- Sabe quando avançar com autonomia e quando uma decisão exige alinhamento.
- Documenta regras de negócio, decisões e limitações das soluções.
- Utiliza IA com senso crítico e valida os resultados produzidos.
- Considera qualidade, segurança, custo, escalabilidade e manutenção nas decisões técnicas.
- Equilibra velocidade de entrega, qualidade técnica e valor para o negócio.
- Compartilha conhecimento e aprendizados com o time.
- Assume erros, contribui para a análise das causas e ajuda a evitar recorrências.
- Atua de acordo com os princípios e comportamentos definidos no Manifesto da Datlo.
Formação
Graduação em Ciência da Computação, Engenharia, Estatística, Matemática, Sistemas de Informação, Ciência de Dados ou áreas relacionadas é desejável, 3 anos ou mais de experiência.
Certificações ou formações em GCP, Azure, dbt, Engenharia de Dados, machine learning ou inteligência artificial não são obrigatórias, mas serão consideradas diferenciais.
O que esperamos nos primeiros meses
- Compreender a arquitetura de dados, os padrões de modelagem e as camadas existentes na Datlo.
- Conhecer os principais pipelines, fontes, consumidores e regras de negócio.
- Entender os processos de desenvolvimento, versionamento, deploy e monitoramento.
- Assumir a manutenção e a evolução de pipelines e modelos de média complexidade.
- Contribuir para testes, documentação, observabilidade e qualidade dos dados.
- Conhecer as iniciativas de IA existentes e os dados utilizados por elas.
- Desenvolver ou apoiar uma primeira solução baseada em LLMs, com critérios claros de avaliação.
- Construir uma relação de confiança com os times de Desenvolvimento, Plataforma, Produto e áreas de negócio.
O que você encontrará na Datlo
Um ambiente em que Engenharia de Dados trabalha de forma próxima a Desenvolvimento, Plataforma, Produto e negócio para transformar informações em produtos e decisões.
Você terá espaço para atuar em problemas reais de engenharia de dados, inteligência de mercado e IA aplicada da construção de pipelines e modelos analíticos à disponibilização de soluções baseadas em LLMs, ampliando progressivamente sua autonomia e participação nas decisões técnicas.