Profissional em formação em Gestão de Dados, com foco em Machine Learning, Engenharia de Dados e IA Generativa
Perfil revisado em 27/07/2026.
Profissional em formação em Gestão de Dados pela Universidade Federal do Piauí (UFPI), com foco em Machine Learning, Engenharia de Dados e aplicações com IA Generativa.
Desenvolvo projetos práticos em Python, FastAPI, Airflow, RAG e modelagem preditiva, com ênfase em validação de resultados, qualidade de dados e construção de sistemas orientados a decisão.
Para uma visão mais organizada dos meus projetos, com contexto, imagens e informações de contato, acesse meu portfólio técnico:
Portfólio: umbura.github.io
- Desenvolvimento de backends de dados e ML com FastAPI, Airflow, DuckDB, SQL, RAG e validação automatizada.
- Experimentos de Machine Learning aplicado envolvendo preparação de dados, avaliação estatística e validação de resultados.
- Pesquisa em NLP, datasets para línguas de baixo recurso e detecção de ofensividade em português brasileiro.
- Documentação dos repositórios em inglês e português sempre que possível.
-
FraudRisk Engine
Backend para score de fraude com FastAPI e XGBoost, integrando revisão humana, auditoria e monitoramento de drift. Em holdout temporal com 42.722 transações reais, detectou 44 de 52 fraudes, com 84,6% de recall e apenas 0,817% das transações encaminhadas para revisão. -
Airflow Data Quality Pipeline
Pipeline de dados de varejo com Airflow, DuckDB e FastAPI, cobrindo ingestão, validação, transformação e publicação. Processou 541.909 registros, aprovou 25/25 verificações de qualidade, gerou 4 marts analíticos e inclui 35 testes automatizados com 94% de cobertura. -
QueryGuard RAG
Backend Text-to-SQL governado por catálogo semântico, com políticas por função, bloqueio de dados sensíveis, validação via sqlglot, execução somente leitura e auditoria. Alcançou 50/50 casos na avaliação determinística e 5/5 no fallback com LLM, com 72 testes automatizados. -
AI Ops Approval Workflow
Triagem operacional assistida por IA com aprovação humana, auditoria, suporte a OpenAI Responses API e orquestração com n8n.
-
I Speak Kanoê: Engineering a Dataset for an Endangered Isolated Language
SBBD 2026 DSW - artigo aceito, com publicação prevista nos anais.
Link: Hugging Face -
Modelos Lexicais Calibrados para Detecção de Ofensividade em Português Brasileiro: um Estudo no ToLD-Br
SBBD 2026 Short Papers - artigo aceito, com publicação prevista nos anais.
Em breve. Os artigos aceitos serão adicionados aqui quando a publicação definitiva estiver disponível nos anais oficiais do SBBD/SBC.