Othniel Tra Bi
ISFA · Projet de Master2023

Détection de fraude en assurance auto

Le problème

La fraude est un phénomène rare et déséquilibré : il faut des modèles capables de la repérer sans noyer les assurés légitimes sous les faux positifs.

Le résultat

Quatre modèles comparés et évalués par AUC-ROC, précision, rappel et F1-score, pour repérer une fraude rare dans des données déséquilibrées.

Les étapes

  1. Prétraitement
  2. Multicolinéarité
  3. Modèles supervisés
  4. Cross-validation
  5. AUC-ROC / F1

Les outils

  • Machine learning
  • Classification
  • Random Forest
  • Gradient Boosting
  • Python

Le contexte

Projet académique de Master appliquant un cycle complet de machine learning supervisé à la détection de fraude en assurance automobile, du prétraitement à l'optimisation des modèles.

Ce que j'ai fait

J'ai réalisé le prétraitement complet (valeurs manquantes et aberrantes, étude de corrélation), la sélection de variables et l'analyse de la multicolinéarité, puis développé et comparé une régression logistique, un Random Forest, un Gradient Boosting et un HDBSCAN.

J'ai optimisé les hyperparamètres par cross-validation et évalué les modèles de manière rigoureuse via AUC-ROC, précision, rappel et F1-score.

Ce que ce projet dit de moi

  • Cycle de machine learning supervisé complet
  • Comparaison de quatre familles de modèles
  • Évaluation par AUC-ROC et F1-score
  • Gestion d'un problème de classes déséquilibrées

Ce projet m'a donné une base solide sur le scoring et la classification en données déséquilibrées, transposable aux problématiques de détection et de risque opérationnel.