Lycée · 2ⁿᵈᵉ · Sciences numériques et technologie (SNT)
Traitement et visualisation des données
Collecter, trier, analyser et représenter graphiquement des données — programme SNT 2nde (lycée général)
À propos de cette page
La donnée : définition et nature
Une donnée (en anglais data) est une information brute, représentée sous une forme exploitable par un ordinateur. Les données peuvent être :
- numériques : entiers, réels (ex. : température, prix, note) ;
- textuelles : chaînes de caractères (ex. : nom, ville) ;
- booléennes : vrai/faux (ex. : majeur : oui/non) ;
- temporelles : dates, heures (ex. : 2024-03-15).
| Nom | Âge | Ville | Note (/20) |
|---|---|---|---|
| Alice | 15 | Marseille | 14 |
| Bob | 16 | Lyon | 11 |
| Carla | 15 | Marseille | 17 |
Collecter et stocker des données
Les données proviennent de nombreuses sources : capteurs, formulaires en ligne, réseaux sociaux, applications mobiles, satellites… Leur collecte massive a donné naissance au concept de Big Data.
CSV (Comma-Separated Values) est l'un des formats les plus utilisés pour stocker des données tabulaires. Chaque ligne correspond à un enregistrement ; les valeurs sont séparées par une virgule (ou un point-virgule).nom,age,ville,note
Alice,15,Marseille,14
Bob,16,Lyon,11
Carla,15,Marseille,17D'autres formats courants sont JSON (utilisé pour les API web) et XML. Pour des données volumineuses ou relationnelles, on utilise des bases de données gérées par un SGBD (Système de Gestion de Bases de Données).
import csv). C'est le point d'entrée standard pour analyser des données.Trier et filtrer des données
Deux opérations fondamentales permettent d'explorer un jeu de données :
- Tri par note décroissante → Carla (17), Alice (14), Bob (11).
- Filtre « ville = Marseille » → Alice et Carla.
- Filtre « note ≥ 14 ET ville = Marseille » → Alice et Carla.
En Python, on peut utiliser des listes en compréhension ou la bibliothèque pandas pour réaliser ces opérations efficacement sur de grands jeux de données.
Calculer sur des données : statistiques de base
Après le tri et le filtrage, on calcule souvent des indicateurs statistiques qui résument le jeu de données.
| Indicateur | Définition | Exemple (notes : 14, 11, 17) |
|---|---|---|
| Minimum | Plus petite valeur | $\min = 11$ |
| Maximum | Plus grande valeur | $\max = 17$ |
| Étendue | $\max - \min$ | $17 - 11 = 6$ |
| Moyenne | $\bar{x} = \frac{\sum x_i}{n}$ | $\bar{x} = \frac{14+11+17}{3} = 14$ |
| Médiane | Valeur centrale après tri | médiane $= 14$ |
notes = [14, 11, 17]
moyenne = sum(notes) / len(notes) # → 14.0
minimum = min(notes) # → 11
maximum = max(notes) # → 17Visualiser des données
La visualisation transforme des données brutes en représentations graphiques pour faciliter leur compréhension. Le choix du graphique dépend du type de données et du message à transmettre.
| Graphique | Usage |
|---|---|
| Diagramme en barres | Comparer des catégories |
| Histogramme | Distribution d'une variable continue |
| Camembert (pie) | Proportions d'un tout (≤6 catégories) |
| Courbe (line) | Évolution dans le temps |
| Nuage de points | Corrélation entre deux variables |
Algorithmes de traitement
Le traitement des données repose sur des algorithmes : des suites d'instructions précises, finies et non ambiguës.
- Parcourir le tableau pour trouver le minimum.
- L'échanger avec le premier élément non encore trié.
- Répéter jusqu'à ce que tout le tableau soit trié.
donnees = [
{"nom":"Alice", "ville":"Marseille", "note":14},
{"nom":"Bob", "ville":"Lyon", "note":11}
]
marseillais = [e for e in donnees if e["ville"] == "Marseille"]En SNT, on décrit les algorithmes en pseudo-code ou en Python sans nécessité de les optimiser ; l'essentiel est de comprendre leur logique.
Qualité et biais des données
Un traitement fiable exige des données de qualité. Plusieurs problèmes peuvent altérer les résultats :
- Valeurs manquantes : un champ vide fausse les calculs (ex. : une note absente abaisse la moyenne si on la compte comme 0).
- Valeurs aberrantes (outliers) : une valeur très éloignée des autres (ex. : une note de 200/20 due à une saisie erronée).
- Doublons : un même enregistrement présent deux fois gonfle les effectifs.
- Biais de collecte : si l'échantillon n'est pas représentatif de la population, les conclusions sont biaisées (ex. : sondage fait uniquement en ligne excluant les non-connectés).
Enjeux éthiques et protection des données
La collecte et le traitement massifs de données personnelles soulèvent des enjeux éthiques et juridiques majeurs.
- Consentement : l'utilisateur doit accepter explicitement la collecte de ses données.
- Finalité : les données ne peuvent être utilisées que pour la finalité déclarée.
- Minimisation : on ne collecte que les données strictement nécessaires.
- Droit d'accès et d'effacement : toute personne peut consulter et demander la suppression de ses données.
En France, la CNIL (Commission Nationale de l'Informatique et des Libertés) veille au respect du RGPD et peut sanctionner les entreprises en infraction.
- Une donnée est une information brute (numérique, textuelle, booléenne, temporelle) stockée dans un fichier ou une base de données.
- Un jeu de données tabulaire s'organise en lignes (individus) et colonnes (attributs) ; le format CSV est le plus courant.
- Trier = ordonner ; Filtrer = sélectionner selon un critère.
- Les indicateurs statistiques clés : $\min$, $\max$, moyenne $\bar{x}=\frac{\sum x_i}{n}$, médiane.
- Choisir le bon graphique : barres pour comparer, courbe pour l'évolution, camembert pour les proportions.
- Des données de mauvaise qualité (manquantes, aberrantes, biaisées) conduisent à des conclusions erronées.
- Le RGPD protège les données personnelles en Europe ; la CNIL veille à son application en France.
Cours particuliers de sciences numériques et technologie (snt) à Marseille, en présentiel ou à distance — un prof qui s'adapte à ton rythme et reprend ce qui coince.
Soutien scolaire à Marseille · Cours particuliers au lycée · Aide aux devoirs