// blog

Os bastidores entre o dado e a decisão

Machine learning, estatística aplicada e IA — contados a partir de projetos reais, com os números na mesa e os erros incluídos. Tudo que publico aqui também vira conversa no LinkedIn.

★ artigo em destaque · série completa

Prevendo LTV do zero ao deploy: um projeto CRISP-DM completo

38.753 clientes, quatro modelos, uma restrição inegociável (nada de data leakage) e um deploy que virou decisão de verdade. O case completo do projeto de Lifetime Value — incluindo dados que mentem, distribuições bimodais, multicolinearidade e o dia em que a regressão linear venceu o Random Forest.

2026: o ano em que os agentes de IA encontraram a operação

O Gartner projeta 40% dos projetos de IA agêntica cancelados até 2027 — e a mortalidade se concentra no mês oito, quando o piloto funciona e a conta chega. As três causas não são sobre o modelo, e o MCP está crescendo exatamente na direção delas.

ai-agentsmcpanálise

Prompt resolve comportamento, arquitetura resolve operação

Cinco agentes de IA atendendo por e-mail 24/7 — com RAG, memória por conversa e ações reais. E a lição do protótipo perfeito que não atendia ninguém: identidade antes de intenção, orquestrador mudo e custo como decisão de design.

ai-agentsragn8n

IA onde há ambiguidade, automação onde há regra

Conciliação de notas fiscais com IA multimodal: por que o RPA clássico quebra na leitura do documento, onde o LLM entra (e onde não deve entrar) — e o ponto mais frágil de toda conciliação, que não é a IA.

ia-aplicadan8nautomação

Os dados sujos: quando .isnull() mente para você

A contagem dizia 5% de nulos. A realidade era 50,2% numa única coluna — mascarada em zeros, textos e rendas de R$ 9 quintilhões. Nem todo dado ausente se apresenta como ausente.

data-qualitypandaseda

A assimetria que não era assimetria

Fisher dizia +1,02; Bowley dizia −0,05. Quando duas medidas do mesmo fenômeno discordam, a discordância É o achado — e o histograma revelou uma distribuição bimodal.

estatísticaedadistribuições

Quando o Random Forest perde para a regressão linear

Quatro modelos, validação cruzada em 5 folds — e o mais simples venceu com folga. Por que isso é informação, não fracasso, e a matriz singular que a métrica escondeu.

machine-learningvalidação-cruzadaregressão
// série · case completo

Aurora — Risco de Crédito

🏦 série completa · 12 partes + mapa

Aurora: um modelo de risco de crédito do zero ao deploy

150 mil solicitantes, 5 modelos, ROC AUC 0,8692 em dados nunca vistos. Do arquivo que nem abre no pandas até o ponto de corte que minimiza o custo da carteira — passando pelo conversor que apagaria 2.950 clientes em silêncio e pelo conselho de internet que teria negado 87% da carteira.

Seis armadilhas numa base de crédito

O conversor com errors="coerce" que apagaria 2.950 clientes com 40% de inadimplência — em silêncio. Mais sentinelas 96/98, teto artificial e a ausência que é sinal de risco menor.

data-qualityeda

Cinco candidatos e um piso de comparação

Num problema com 6,7% de inadimplência, 93,3% de acurácia é o resultado de aprovar todo mundo. Por isso o modelo burro entra como candidato oficial, não como curiosidade.

baselinevalidação-cruzada

A árvore que decorou a base inteira

ROC AUC 0,99997 no treino, 0,6148 na validação. A poda recuperou +0,231 — e o conselho padrão de balancear classe teria negado 87% da carteira.

overfittingcalibração

Boosting: dois caminhos, o mesmo desenho vencedor

50 sorteios de hiperparâmetros. XGBoost e LightGBM convergiram para taxa de aprendizado baixa, muitas árvores e regularização forte — por rotas opostas.

xgboostlightgbm

O ponto de corte que vale milhares de reais

O modelo entrega probabilidade; quem traça a linha é o negócio. Por que o 0,5 de fábrica está errado e como o limiar sai do custo do erro.

decisãocusto-esperado
// série

Machine Learning para Decisão

📚 série completa · 9 partes + mapa

Machine Learning para Decisão em 9 frases — o mapa da série

Nove princípios que separam modelo de decisão: do que é ML de verdade até a pergunta que fecha tudo — dá para confiar nos modelos? Nove artigos, um arco completo, e o resumo visual em carrossel PDF para baixar.

ML é o motor. Ciência de Dados é o carro inteiro

"IA generativa não é machine learning"? Errado. As 4 lentes da análise, o retrovisor vs. o farol — e por que dashboard que não vira ação é custo com aparência de inovação.

série-mlmachine-learningfundamentos

Os 5 tipos de problema que o Machine Learning resolve

Prever, categorizar, agrupar, recomendar, detectar o atípico — e os três testes que dizem se o seu caso é mesmo um problema de ML ou um problema de processo.

série-mlmachine-learningnegócios

Quando usar (e quando não usar) Machine Learning

A arte de matar projetos na hora certa: as 3 viabilidades, o funil de 5 perguntas, a escada da complexidade — e por que um modelo é um pet, não um móvel.

série-mlestratégiamachine-learning

Do negócio ao problema de dados

"Reduzir churn" é um desejo, não um problema de ML. A anatomia do dataset, as 7 perguntas de tradução e o data leakage que mais derruba projeto júnior.

série-mldata-leakagemodelagem

CRISP-DM: um GPS que recalcula, não um trilho

As 6 fases do ciclo de vida de um projeto de dados, a divisão honesta do esforço (~80% dados, ~20% modelo) e a armadilha de se apaixonar pelo algoritmo.

série-mlcrisp-dmmlops

Os três paradigmas de aprendizado

Supervisionado = estudar com gabarito. Não supervisionado = festa sem lista de convidados. Reforço = adestrar com petiscos — e o RLHF por trás dos LLMs que você usa.

série-mlrlhfmachine-learning

O mapa dos modelos: No Free Lunch

As 5 famílias de modelos e a vocação de cada uma. Tabular → árvores e boosting; não estruturado → deep learning. E por que "mais complexo = melhor" é falso.

série-mlxgboostdeep-learning

Dá para confiar nos modelos?

99% de acerto pode ser inútil. Generalização, overfitting, matriz de confusão, baseline e as três armadilhas — o fecho da série com a frase certa: o modelo prevê, o humano decide.

série-mloverfittingavaliação

Machine Learning para Decisão em 9 frases

O mapa completo da série, com link para as 9 partes e o carrossel em PDF para baixar. Se você chegou agora, comece por aqui.

série-mlmapa-da-sériepdf

Em breve: feature engineering na prática (por que tratar mês como número quebra o modelo) e multicolinearidade — os capítulos que faltam do projeto de LTV. Me acompanhe no LinkedIn para saber quando sai artigo novo.