Othniel Tra Bi
LinkPact · Projet R&DJuin 2024 à août 2024

Tarification immobilière (préparation IARD)

Le problème

Un modèle de pricing performant reste inutile s'il n'est pas explorable et challengeable par les équipes qui doivent l'exploiter au quotidien.

Le résultat

Un modèle de prix validé par RMSE après comparaison de quatre familles de modèles, restitué dans une interface Shiny que des équipes non techniques peuvent explorer.

Les étapes

  1. Analyse exploratoire
  2. Sélection de variables
  3. Modèles ML
  4. Validation RMSE
  5. Prix prédit

Les outils

  • Machine learning
  • GLM
  • GAM
  • Random Forest
  • R-Shiny

Le contexte

Projet de préparation à la tarification IARD : modélisation sur données Kaggle, suivie de la création d'une interface Shiny permettant une prise en main intuitive du modèle produit.

Ce que j'ai fait

J'ai mené un cycle complet : corrélations (Pearson, Cramér's V), détection de multicolinéarité (VIF), sélection stepwise avec cross-validation, encodage des variables ordinales, détection d'anomalies (Isolation Forest) et comparaison des modèles GLM, GAM, Random Forest et Gradient Boosting.

Après optimisation des hyperparamètres et validation par RMSE, j'ai restitué le modèle dans une interface Shiny avec exploration dynamique des variables et visualisation des performances, pensée pour une prise en main rapide par des équipes non techniques.

Ce que ce projet dit de moi

  • Pipeline ML complet, de l'exploration à la validation
  • Comparaison de plusieurs familles de modèles
  • Détection d'anomalies (Isolation Forest)
  • Interface de pricing orientée usage métier

Ce projet a consolidé ma maîtrise d'un pipeline de machine learning de bout en bout appliqué à la tarification, de la donnée brute jusqu'à l'outil utilisable.