Ce projet propose une analyse statistique approfondie pour modéliser et prédire la concentration d'ozone à New York. En utilisant le jeu de données airquality, nous explorons différentes techniques de régression pour données de comptage afin de comprendre l'influence des facteurs environnementaux.
L'étude se concentre sur l'impact du rayonnement solaire (Solar.R), du vent (Wind) et de la température (Temp) sur les niveaux d'ozone. Une partie importante du projet est dédiée à l'identification de la surdispersion et à l'application de modèles robustes pour la corriger.
- Exploration des données : Visualisation des relations entre les variables environnementales.
- Modélisation de Poisson : Mise en place du modèle de base et interprétation des coefficients (IRR).
- Diagnostics avancés : Tests de surdispersion (Z-score de Hilbe), test de Hosmer-Lemeshow et analyse des résidus.
- Modèles de recours : Implémentation de régressions Quasi-Poisson et Binomiale Négative pour gérer la variance excessive.
- Optimisation : Utilisation de modèles pondérés pour améliorer la précision des prédictions face aux valeurs extrêmes.
index.html: Rapport final interactif déployé sur GitHub Pages.codes/: Dossier contenant les sources du projet.regPoisson_ozone.qmd: Notebook Quarto source (code R et texte).libraries.R: Liste des dépendances nécessaires.regression_poisson.Rproj: Fichier de projet RStudio.renv.lock: Verrouillage des versions des packages pour la reproductibilité.
img/: Graphiques et visualisations exportés.
Les packages principaux utilisés sont : ggplot2, MASS, ResourceSelection, et performance.
Pour restaurer l'environnement exact de travail :
install.packages("renv")
renv::restore()- Naviguez dans le dossier
codes/et ouvrezregression_poisson.Rproj. - Ouvrez le fichier
regPoisson_ozone.qmd. - Utilisez le bouton Render dans RStudio pour générer le rapport.
Le projet est hébergé sur GitHub Pages. La page d'accueil est générée à partir du fichier index.html à la racine.
L'analyse conclut que le modèle Binomial Négatif pondéré offre la meilleure performance, car il traite efficacement la surdispersion et minimise l'impact des observations atypiques dans les données airquality.
Projet réalisé en groupe dans le cadre d'une étude sur les modèles linéaires généralisés (GLM).
Membres du groupe :
- DESSOU Lysias
- HOMEVO Kafui