Activité 1 - analyse exploratoire

L’analyse exploratoire est essentielle pour faire des vérifications d’usage lors d’une analyse de données, s’assurer que ces dernières sont conformes à nos attentes, vérifier la présence de valeurs aberrantes, etc. et établir une stratégie pour l’analyse et la modélisation. Se renseigner sur la nature des données et l’échantillonnage est essentiel pour choisir des modèles adéquats.

Téléchargez les données

Marathon de Berlin

Les données que nous analyserons ensemble sont les résultats du marathon de Berlin en 2022, épreuve officielle du World Marathon Majors et durant lequel le coureur Eliud Kipchoge bas son propre record du monde en complétant le parcours en 2 heures, 1 minute et 9 secondes.

Les données incluent les variables (en colonne) suivantes:

  • position: rang absolu
  • position_gender: rang par sexe
  • country: code à trois lettre pour indiquer la nationalité de l’athlète
  • sex: variable catégorielle, M pour homme et F pour femme
  • division: numéro de la divison
  • bib: numéro bib d’identifiant du participant
  • starttime: temps de départ au format HH:MM:SS de la vague
  • start_raw_time: temps de départ (chronomètre)
  • half: temps à mi-parcours (HH:MM:SS)
  • 5k: temps à 5km du départ (HH:MM:SS)
  • 10k: temps à 10km du départ (HH:MM:SS)
  • 15k: temps à 15km du départ (HH:MM:SS)
  • 20k: temps à 20km du départ (HH:MM:SS)
  • 25k: temps à 25km du départ (HH:MM:SS)
  • 30k: temps à 30km du départ (HH:MM:SS)
  • 35k: temps à 35km du départ (HH:MM:SS)
  • 40k: temps à 40km du départ (HH:MM:SS)
  • grosstime: temps brut de fin du parcours
  • nettime: temps net (calculé à partir du chronomètre)
  • category: catégorie (sexe et tranche d’âge)

Questions initiales

Voici quelques questions pour démarrer votre analyse exploratoire

  • Est-ce qu’il y a des données manquantes? Si oui, décrivez sous quelle forme et le mécanisme en cause.
  • Est-ce que les participant(e)s des différentes vagues sont alloués aléatoirement à ces dernières?
  • Qu’est-ce qui est pris en compte pour le classement, le temps brut ou net?
  • Échantillonnage: quelles sont les conditions pour inclusion dans la base de données (temps maximaux à la ligne d’arrivée et à mi-temps, heure maximale) et pour courir le marathon en premier lieu?
  • Qu’est-ce qui distingue les champions des personnes ordinaires?
  • Quels sont les temps attendus dans les différentes catégories (entre sexe et pour les différentes tranches d’âge).
  • Est-ce que le classement des 10 plus rapides est demeuré constant au fil de la course?
  • Comment évolue la vitesse moyenne durant la course des coureurs d’élite (versus les autres)?
  • Quels sont les prérequis pour participer au marathon? Le site web mentionne le tirage au sort, des billets donnés à des organismes de charité, des tours opérateurs.

Quelques analyses intéressantes sur ce blogue pour les deux éditions suivantes montrent le genre de comparaisons possibles si on considérait plusieurs éditions. Une analyse exploratoire succincte est disponible ici.

Conclusions du groupe 1

  1. Pourquoi le nombre de position n’est pas égal au nombre d’observations? Réponse: il y a 727 abandons.

  2. Est-ce que les codes bib correspondent uniquement à des femmes (f)? Réponse: il y a 202 codes qui commencent par f, tous associés à des participantes (mais une minorité d’entre elles, car elles représentent le tiers des inscriptions).

  3. À quoi correspondent les trois lettres des codes des pays: est-ce au standard international ISO 3166-1 A-3? Réponse:non, plutôt ceux du Comité international olympique (CIO). Certaines personnes ont déclaré des pays fantaisistes (souvent plus de trois caractères, dont AKA JUSTIN, CINDY, NANNY et SUZY).

  4. Est-ce que les personnes de sexe inconnu ou non-déclaré figurent au classement position_gender? Réponse: Non

Résumé

  • Tous les inscrits n’ont pas pris part à la compétition et certains temps sont manquants, soit pour absence au départ, abandon ou disqualification (absence de départ, abandon ou disqualification). La variable position prend la valeur DNF pour ceux qui n’ont pas complété, incluant les absences. La variable position_gender inclut 53 personnes disqualifiées (code DSQ). La variable position prend une valeur unique, mais pas position_gender pour laquelle il y a des doublons dans les temps.

  • Les pays de provenance des coureurs sont sans surprise l’Allemagne (11115), les États-Unis (6110), le Royaume-Uni (2109), le Mexique (1228), la France (1144). Les pays de l’hémisphère nord (Européens et nord-Américains) sont bien représentés. Les temps les plus rapides sont réalisés par des Africains, tout sexe confondu.

  • Certains temps intermédiaires sont manquants (même si la personne a complété la course et que le temps final est connu).

  • Sept personnes n’ont pas déclaré de sexe (valeur manquante) et donc ne sont pas dans une catégorie (sexe et âge, avec les lettres W et M pour les catégories féminin/masculin et des groupes d’âge de junior (JU20 pour les juniors entre 18 et 20 ans Männliche Jugend U20, MH et WH for Männer Hauptklasse et Weiblich Hauptklasse pour 20 à 29 ans).

Le temps de départ effectif est starttime, et le temps réel de complétion est nettime. La variable start_raw_time correspond au temps de départ des quatre vagues (9h15, 9h35, …) — on pourrait transformer cette variable en variable catégorielle avec quatre modalité pour les quatre vagues.

Remerciements

Les données proviennent de Marcel Caraciolo via Github