Na Confederação da Agricultura e Pecuária do Brasil - CNA contamos com um time de tecnologia com profissionais experientes.
Profissional responsável por projetar, construir e manter pipelines de dados que alimentam tanto sistemas analíticos tradicionais (BI, relatórios) quanto soluções de Inteligência Artificial (busca semântica, RAG, treinamento e avaliação de modelos).
Requisitos Obrigatórios
-
Nível superior completo em Engenharia de Dados, com especialização na área de TI.
-
Experiência robusta em Linguagens: SQL avançado; Python (pandas, PySpark); shell scripting.
-
Orquestração: Airflow ou similar; versionamento de pipelines.
-
Processamento: Batch (Spark) e streaming (Kafka, Logstash); processamento distribuído.
-
Armazenamento: Data warehouses (SQL Server, ClickHouse, Fabric); data lakes; formatos colunares (Parquet).
-
Bancos de dados: SQL Server, PostgreSQL, bancos NoSQL/, bancos de busca (Elasticsearch/OpenSearch).
-
Infraestrutura: Kubernetes, containers, CI/CD para pipelines de dados.
-
Modelagem: Modelagem dimensional, Arquitetura Medalhão, qualidade e testes de dados.
-
Observabildade e observabilidade de dados.
-
Linux.
-
API Rest.
-
Conhecimento em banco de dados relacionais (DML, DDL, Postgres, SQL Server, Oracle).
-
Utilizar ambiente e linguagens para manipulação de dados nos diversos modelos de SGBD.
Principais Atividades e Responsabilidades
-
Projetar, monitorar e manter pipelines de ingestão, transformação e carga (ETL/ELT) em lote e streaming em ambiente on-premisses e nuvem (AWS).
-
Garantir qualidade, linhagem e governança de dados.
-
Modelar dados para consumo analítico e para consumo por sistemas de IA (chunking, embeddings, feature stores).
-
Construir e operar pipelines específicos de IA: geração e atualização de embeddings, indexação em bancos vetoriais, preparação de datasets de treinamento/avaliação.
-
Monitorar performance, custo e disponibilidade dos pipelines (observabilidade de dados)
-
Colaborar com Engenharia de Software e Ciência de Dados na definição de contratos de dados e SLAs.
-
Garantir segurança, privacidade e conformidade no uso de dados por modelos de IA (mascaramento, anonimização, controle de acesso).
-
Projetar crescimento do ambiente de dados otimizando os recursos de infraestrutura.
Diferenciais Desejáveis
-
Conhecimento prático em Apache Airflow para orquestração, monitoramento e automação de alertas de pipelines de ingestão de dados;
-
Familiaridade com arquiteturas multiagentes de IA e o desenvolvimento de roteadores dinâmicos de agentes especializados;
-
Práticas consolidadas de DevOps / DevSecOps e automação de alertas operacionais integrados com o Microsoft Teams e abertura automática de incidentes via Jira;
-
Experiência no ecossistema de dados do agronegócio e alta disponibilidade de sistemas voltados ao produtor rural.
Benefícios:
Assistência Médica e Odontológica, vale-transporte, tíquete alimentação/refeição, plano de previdência privada, seguro de vida corporativa e gratificação por desempenho.
Regime de Contratação:
CLT
Departamento:
ASSESSORIA DE TECNOLOGIA DA INFORMAÇÃO E INOVAÇÃO -ATII