"Queremos usar machine learning para reduzir a inadimplência." Isso não é um problema de dados — é um desejo. A tradução de um para o outro cabe em sete perguntas, e é nelas que o projeto inteiro se decide. Errar aqui produz um modelo que responde com precisão à pergunta errada.
As sete perguntas, respondidas
| Pergunta | Resposta no projeto |
|---|---|
| 1. Qual a decisão? | Aprovar ou negar crédito — e em que condições |
| 2. Qual a pergunta preditiva? | Probabilidade de 90+ dias de atraso nos próximos 2 anos |
| 3. Qual a unidade de análise? | O solicitante: uma linha, uma previsão |
| 4. Qual o alvo? | inadimplente_2anos — 1 se atrasou 90+ dias |
| 5. Que tipo de tarefa? | Classificação com probabilidade, para permitir ponto de corte |
| 6. Quais features? | Só o que existe antes da aprovação |
| 7. Como meço sucesso? | ROC AUC ≥ 0,85 e custo esperado menor que a política atual |
A pergunta 6 é a que derruba projeto
A regra de ouro em crédito: só entra na modelagem o que se sabe no instante da decisão. Qualquer informação posterior — se o cliente renegociou, se entrou em cobrança, se o limite foi cortado — é vazamento de dados. Ela infla a métrica no treino e desaparece em produção, porque na hora de aprovar aquele dado ainda não existe.
A pergunta 7 é a que separa modelo de decisão
Duas métricas, não uma. A técnica é o ROC AUC ≥ 0,85. A de negócio é o custo esperado da carteira — e ela depende de um número que raramente aparece em tutorial: os erros não custam a mesma coisa.
| Tipo de erro | O que é | Custo |
|---|---|---|
| Falso negativo | Aprovei quem não pagou | R$ 5.000 |
| Falso positivo | Neguei quem pagaria | R$ 500 |
Uma assimetria de 10 para 1. E dela sai, por derivação direta, o limiar teórico de corte:
p* = 1 / (1 + 10) = 9,09%
Ou seja: vale negar qualquer proposta com probabilidade de inadimplência acima de 9,09%, porque acima disso o prejuízo esperado do calote supera o lucro perdido ao recusar um bom cliente. Esse número, definido na primeira fase, volta para decidir o projeto na última.
Repare no que não aparece nessas sete perguntas: qual algoritmo usar. Essa é a última decisão do projeto, não a primeira.
Parte 2 de 12 da série Aurora — um modelo de risco de crédito do zero ao deploy. O mapa completo da série reúne todas as partes e os números finais. Veja também a documentação técnica e o código no GitHub ↗.