Daniel Costa

Cientista de dados que entrega modelos de previsão que sobrevivem à produção

Cientista de dados com sete anos a construir sistemas de previsão e otimização que correm em produção, não em notebooks. Atualmente responsável pela previsão da procura numa plataforma de supermercado onde as melhorias dos modelos reduziram o desperdício de perecíveis em 18% em 140 lojas. À vontade com o percurso completo: enquadramento do problema, modelação, deployment e a monitorização que o mantém honesto.

Cientista de Dados Sénior, Previsão

de março de 2022 até ao presente

Responsável pela previsão da procura ao nível da loja que alimenta o reaprovisionamento de 140 lojas e cerca de 30.000 SKUs.

  • Substituiu um pipeline estatístico antigo por um modelo hierárquico de gradient boosting, melhorando o WAPE ao nível do SKU de 34% para 24%.
  • As melhorias de previsão reduziram o desperdício de perecíveis em 18% e as ruturas de stock em 11%, num valor estimado de 6 milhões de euros por ano.
  • Construiu monitorização de drift e backtesting automatizado; degradações silenciosas dos modelos passaram a ser detetadas em horas em vez de semanas.
  • Conduz a revisão trimestral de previsão com a direção da cadeia de abastecimento, traduzindo o comportamento dos modelos em decisões de compra.
PrevisãoGradient boostingMLOpsRetalho

Cientista de Dados

de setembro de 2019 a fevereiro de 2022

Previsão de curto prazo de carga e renováveis para um comercializador de energia a equilibrar uma carteira de 400MW.

  • Melhorou o MAPE da previsão de carga para o dia seguinte de 4,1% para 2,9%, reduzindo os custos de balanço em cerca de 1,2 milhões de euros por ano.
  • Construiu um modelo probabilístico de produção solar usado pela mesa de trading para dimensionar posições intradiárias.
  • Introduziu padrões de feature store que reduziram o tempo de iteração de novos modelos de semanas para dias.
Séries temporaisPrevisão probabilísticaMercados de energia

Analista de Dados

de outubro de 2017 a agosto de 2019

Analítica de clientes e sortido para clientes de retalho.

  • Construiu um modelo de scoring de churn para um cliente de telecomunicações que multiplicou por 2,3 a conversão das campanhas de retenção face à seleção aleatória.
  • Automatizou a stack semanal de reporte a clientes, libertando cerca de um dia de analista por semana.
PythonSQLModelação de churn

reconcile-ts

de junho de 2023 até ao presente

Biblioteca Python que implementa reconciliação MinT e bottom-up com uma API compatível com scikit-learn.

  • Mais de 700 estrelas no GitHub; usada em pelo menos quatro stacks de previsão de retalho em produção, segundo relatos de utilizadores.
  • A suite de benchmarks reproduz resultados publicados de reconciliação em três conjuntos de dados públicos.
Open sourcePythonPrevisão

Workshop de Previsão com ML de Lisboa

de setembro de 2024 até ao presente

Workshop prático noturno sobre previsão em produção, realizado duas vezes por ano numa comunidade local de dados.

  • Formou mais de 90 profissionais em quatro turmas, com uma avaliação média de 4,8/5.
  • Todos os materiais em open source, incluindo um conjunto de dados sintético e realista de supermercado.
EnsinoComunidade

Mestrado em Matemática Aplicada e Ciência de Dados

de setembro de 2015 a julho de 2017

Tese sobre métodos de reconciliação hierárquica para previsão da procura no retalho.

Séries temporaisOtimizaçãoEstatística

Licenciatura em Matemática

de setembro de 2012 a junho de 2015
ProbabilidadeMétodos numéricos

Stack de ML de ponta a ponta, da engenharia de features à monitorização em produção.

Python (pandas, scikit-learn)Gradient boosting (LightGBM, XGBoost)Previsão de séries temporaisModelação probabilísticaSQL e dbtAirflowMLflow e registo de experiênciasMonitorização de modelos e deteção de driftSparkComunicação com stakeholders

Trabalha em equipas onde o inglês é a primeira língua; português nativo.

Português (nativo)Inglês (C1)Espanhol (B2)

Professional Cloud ML Engineer

emitida em janeiro de 2024

Certificação que cobre o desenho, o deployment e a monitorização de pipelines de ML em infraestrutura cloud gerida.

MLOpsCloud