Sobre a vaga:
Estamos buscando uma pessoa Cientista de Dados Sênior para atuar na pesquisa, experimentação e desenvolvimento de soluções de Inteligência Artificial Multimodal, Machine Learning e IA Generativa.
A posição terá forte atuação em ambientes de pesquisa aplicada, conectando hipóteses e experimentos a soluções mensuráveis e com potencial de evolução para produção. O desafio envolve trabalhar com diferentes tipos de dados — como imagens, vídeos, textos, metadados, embeddings e dados estruturados — utilizando modelos fundacionais, arquiteturas de recuperação e técnicas modernas de IA.
Buscamos uma pessoa com perfil altamente analítico, curiosidade técnica e capacidade de transformar problemas complexos em experimentos estruturados, avaliáveis e reproduzíveis.
Principais responsabilidades:
- Pesquisar, projetar e prototipar soluções de IA multimodal e IA Generativa para classificação e enriquecimento automático de imagens, vídeos, textos e metadados.
- Desenvolver soluções que combinem diferentes modalidades, incluindo texto, imagens, áudio e dados estruturados.
- Estruturar e conduzir experimentos de forma sistemática, contemplando definição do problema, formulação de hipóteses, experimentação, avaliação e iteração.
- Investigar diferentes modelos, arquiteturas e estratégias para identificar as abordagens mais adequadas para cada problema.
- Trabalhar com LLMs e modelos fundacionais, indo além da engenharia de prompts e explorando estratégias de interação, contexto, recuperação e avaliação.
- Desenvolver e otimizar prompts, structured outputs e estratégias de interação com modelos fundacionais, buscando respostas consistentes, controláveis e mensuráveis.
- Projetar e implementar arquiteturas de Retrieval-Augmented Generation (RAG), utilizando embeddings, busca vetorial, similarity search, filtros por metadados, reranking e otimização de Top-K.
- Definir thresholds e estratégias de recuperação de informação de acordo com os objetivos de cada solução.
- Criar, organizar, curar e utilizar datasets anotados, golden datasets e ground truth para experimentação e avaliação de modelos.
- Desenvolver frameworks de avaliação quantitativa para medir a qualidade dos modelos e soluções desenvolvidas.
- Trabalhar com métricas como Precision, Recall, F1-Score, Top-K Accuracy e Confusion Matrix, incluindo análises segmentadas por classe.
- Aplicar técnicas de Computer Vision e processamento de imagens e vídeos, incluindo extração de frames, pré-processamento, feature extraction e utilização de modelos multimodais.
- Desenvolver protótipos, APIs e serviços de inferência utilizando Python e FastAPI ou frameworks similares.
- Colaborar com profissionais de Engenharia de Software e Engenharia de Dados para transformar protótipos e pesquisas em soluções implementáveis.
- Documentar experimentos, datasets, métricas, decisões técnicas, hipóteses e resultados de forma clara e reproduzível.
- Contribuir para práticas de governança, reutilização e evolução das soluções de IA.
- Apoiar a evolução dos protótipos em direção a soluções escaláveis e preparadas para ambientes produtivos.
Requisitos obrigatórios:
- Experiência profissional sólida como Cientista de Dados, Machine Learning Engineer ou profissional de IA aplicada.
- Forte compreensão de sistemas modernos baseados em LLMs, indo além do uso básico de prompts.
- Experiência prática com IA multimodal, combinando, por exemplo, texto com visão computacional, áudio ou dados estruturados.
- Experiência na definição e condução de experimentos controlados, com capacidade de interpretar resultados e tomar decisões a partir dos dados.
- Domínio de Python para desenvolvimento de aplicações e soluções de IA Generativa.
- Experiência no desenvolvimento de APIs e serviços de inferência/prototipação, utilizando Python, FastAPI ou frameworks similares.
- Experiência com arquiteturas de Retrieval e RAG, incluindo:
- Embeddings;
- Busca vetorial;
- Similarity Search;
- Metadata Filtering;
- Reranking;
- Definição de thresholds;
- Otimização de Top-K.
- Experiência na construção, curadoria e utilização de datasets anotados, golden datasets e ground truth para treinamento, experimentação e avaliação de modelos.
- Conhecimentos práticos de Computer Vision e processamento de imagens e vídeos, incluindo extração de frames, pré-processamento, feature extraction e utilização de modelos multimodais.
- Inglês avançado, tanto para comunicação escrita quanto verbal.
- Ensino superior completo em Ciência da Computação, Engenharia, Estatística, Matemática, Ciência de Dados ou áreas correlatas.
- Formação complementar em Machine Learning, Inteligência Artificial ou áreas relacionadas será considerada um diferencial.
Requisitos desejáveis:
- Experiência prática com Google Cloud Platform (GCP) e Vertex AI.
- Experiência com Gemini, embeddings, Vector Search, BigQuery e outros serviços relacionados ao ciclo de vida de soluções de IA.
- Experiência ou familiaridade com Model Context Protocol (MCP) para integração de agentes com ferramentas, APIs e serviços externos.
- Familiaridade com frameworks para construção e orquestração de agentes de IA.
- Conhecimentos de MLOps e práticas de monitoramento de modelos em produção.
- Experiência com soluções de IA em ambientes produtivos e/ou de pesquisa aplicada.
- Orientação a resultados e capacidade de transformar descobertas técnicas em soluções de valor.
- Organização e disciplina para documentação e reprodução de experimentos.
- Capacidade de apresentar resultados técnicos para diferentes públicos.