Lycée · 2ⁿᵈᵉ · Sciences numériques et technologie (SNT)
Traitement et visualisation des données
Collecter, trier, analyser et représenter graphiquement des données — programme SNT 2nde (lycée général)
À propos de cette page
Choisis ton niveau. Questions et réponses mélangées à chaque partie. Bonne chance !
Les 37 questions du QCM en version texte
Pour réviser sans écran ou imprimer : chaque question avec ses propositions ; la bonne réponse et son explication se déplient.
Niveau facile — 12 questions
Que signifie l'acronyme CSV ?
- A. Comma-Separated Values
- B. Computer Saved Variables
- C. Code Source Variable
- D. Central Server View
Réponse
A. Comma-Separated Values — CSV = Comma-Separated Values (valeurs séparées par des virgules).
Dans un tableau de données, une ligne représente :
- A. Un attribut
- B. Un fichier
- C. Un individu (enregistrement)
- D. Un type de données
Réponse
C. Un individu (enregistrement) — Chaque ligne d'un tableau correspond à un individu ou enregistrement ; chaque colonne est un attribut.
Quel type de données peut uniquement prendre les valeurs « vrai » ou « faux » ?
- A. Entier
- B. Réel
- C. Texte
- D. Booléen
Réponse
D. Booléen — Un booléen (ou variable logique) ne prend que deux valeurs : vrai (True) ou faux (False).
Trier un tableau signifie :
- A. Supprimer des lignes
- B. Ordonner les enregistrements selon un critère
- C. Calculer la moyenne
- D. Créer un graphique
Réponse
B. Ordonner les enregistrements selon un critère — Trier = ordonner les données selon un attribut (croissant, décroissant, alphabétique…).
Quel graphique est le mieux adapté pour montrer l'évolution d'une température sur 12 mois ?
- A. Camembert
- B. Nuage de points
- C. Courbe
- D. Barres empilées
Réponse
C. Courbe — Une courbe représente bien l'évolution d'une variable au fil du temps.
La médiane d'un jeu de données est :
- A. La valeur la plus fréquente
- B. La valeur centrale après tri
- C. La somme divisée par l'effectif
- D. La différence max-min
Réponse
B. La valeur centrale après tri — La médiane est la valeur qui partage l'ensemble trié en deux moitiés égales.
Que fait un filtre sur un tableau de données ?
- A. Il ordonne les lignes
- B. Il supprime les colonnes
- C. Il ne conserve que les lignes vérifiant une condition
- D. Il calcule une moyenne
Réponse
C. Il ne conserve que les lignes vérifiant une condition — Filtrer = sélectionner les enregistrements qui satisfont un prédicat (condition).
Quel format est couramment utilisé pour échanger des données entre applications web ?
- A. CSV
- B. JSON
- C. PDF
- D. PNG
Réponse
B. JSON — JSON (JavaScript Object Notation) est le format standard pour les API web et les échanges de données structurées.
L'étendue d'une série statistique est définie par :
- A. La valeur la plus grande
- B. La somme des valeurs
- C. max − min
- D. moyenne − médiane
Réponse
C. max − min — L'étendue = max − min. Elle mesure la dispersion de la série.
Quel graphique représente des parts d'un tout (pourcentages) ?
- A. Histogramme
- B. Courbe
- C. Camembert
- D. Nuage de points
Réponse
C. Camembert — Le camembert (diagramme circulaire) est adapté pour visualiser des proportions.
Quelle instruction Python calcule la somme d'une liste appelée « notes » ?
- A. len(notes)
- B. max(notes)
- C. sum(notes)
- D. min(notes)
Réponse
C. sum(notes) — sum(notes) renvoie la somme de tous les éléments de la liste.
Combien de colonnes contient le fichier CSV dont la première ligne est « nom,age,ville » ?
- A. 1
- B. 2
- C. 3
- D. 4
Réponse
C. 3 — La ligne d'en-tête contient 3 noms séparés par des virgules → 3 colonnes (attributs).
Niveau moyen — 12 questions
On effectue un filtre « age > 17 » sur un tableau. Quels enregistrements sont conservés ?
- A. Ceux dont l'âge est inférieur à 17
- B. Ceux dont l'âge est égal à 17
- C. Ceux dont l'âge est supérieur à 17
- D. Tous les enregistrements
Réponse
C. Ceux dont l'âge est supérieur à 17 — Le prédicat « age > 17 » ne conserve que les lignes où la valeur de l'attribut age est strictement supérieure à 17.
La moyenne de la série 8, 12, 15, 9, 16 est :
- A. 10
- B. 11
- C. 12
- D. 13
Réponse
C. 12 — Somme = 60, effectif = 5 → moyenne = 60/5 = 12.
Dans quel cas la médiane est-elle préférable à la moyenne ?
- A. Quand les valeurs sont toutes identiques
- B. Quand il y a des valeurs aberrantes
- C. Quand le jeu de données est très grand
- D. Quand toutes les valeurs sont paires
Réponse
B. Quand il y a des valeurs aberrantes — La médiane est robuste aux valeurs aberrantes (outliers) contrairement à la moyenne qui est tirée par les extrêmes.
On trie la liste [5, 1, 3, 2, 4] par tri par sélection. Après la 1re étape, quel est le premier élément ?
- A. 5
- B. 3
- C. 1
- D. 2
Réponse
C. 1 — Le tri par sélection cherche le minimum (1) et l'échange avec le premier élément (5) → [1, 5, 3, 2, 4].
Un graphique en barres a son axe des ordonnées commençant à 50 au lieu de 0. Quel est le risque ?
- A. Le graphique est plus précis
- B. Les différences visuelles sont exagérées
- C. Le graphique ne peut pas être lu
- D. L'axe des abscisses est faussé
Réponse
B. Les différences visuelles sont exagérées — Commencer l'axe à une valeur autre que 0 amplifie visuellement les différences, ce qui peut induire le lecteur en erreur.
Qu'est-ce qu'un doublon dans un jeu de données ?
- A. Une valeur aberrante
- B. Un champ vide
- C. Un enregistrement présent plusieurs fois
- D. Un attribut inutile
Réponse
C. Un enregistrement présent plusieurs fois — Un doublon est un enregistrement identique (ou quasi-identique) apparaissant plusieurs fois, ce qui fausse les statistiques.
Le RGPD est un règlement :
- A. Américain
- B. Français uniquement
- C. Européen
- D. Mondial
Réponse
C. Européen — Le RGPD (Règlement Général sur la Protection des Données) est un règlement de l'Union européenne, en vigueur depuis mai 2018.
Quelle bibliothèque Python est très utilisée pour analyser des tableaux de données ?
- A. matplotlib
- B. numpy
- C. pandas
- D. flask
Réponse
C. pandas — pandas est la bibliothèque de référence pour la manipulation et l'analyse de données tabulaires en Python.
La médiane de la série triée 3, 7, 9, 12, 15, 18 est :
- A. 9
- B. 10,5
- C. 12
- D. 10
Réponse
B. 10,5 — 6 valeurs (pair) → médiane = (9 + 12) / 2 = 10,5.
Quel est l'objectif principal du nettoyage des données (data cleaning) ?
- A. Chiffrer les données
- B. Supprimer toutes les données
- C. Corriger les erreurs et incohérences pour améliorer la qualité
- D. Convertir les données en JSON
Réponse
C. Corriger les erreurs et incohérences pour améliorer la qualité — Le data cleaning vise à corriger les valeurs aberrantes, gérer les manquants et supprimer les doublons.
Quel type de graphique utiliser pour étudier la corrélation entre deux variables quantitatives ?
- A. Camembert
- B. Courbe
- C. Histogramme
- D. Nuage de points
Réponse
D. Nuage de points — Le nuage de points (scatter plot) permet de visualiser la relation (corrélation) entre deux variables quantitatives.
Que signifie « pseudonymiser » des données personnelles ?
- A. Les supprimer définitivement
- B. Les chiffrer avec un mot de passe
- C. Les remplacer par des identifiants anonymes
- D. Les publier en ligne
Réponse
C. Les remplacer par des identifiants anonymes — La pseudonymisation remplace les identifiants directs (nom, prénom…) par des codes, réduisant les risques en cas de fuite.
Niveau difficile — 13 questions
La complexité du tri par sélection pour n éléments est :
- A. $O(n)$
- B. $O(n \log n)$
- C. $O(n^2)$
- D. $O(1)$
Réponse
C. $O(n^2)$ — Le tri par sélection effectue environ n²/2 comparaisons → complexité quadratique O(n²).
Un algorithme de tri par sélection trie la liste [8, 3, 6, 1]. Après 2 étapes complètes, quel est l'état de la liste ?
- A. [1, 3, 6, 8]
- B. [1, 3, 8, 6]
- C. [1, 6, 3, 8]
- D. [3, 1, 6, 8]
Réponse
B. [1, 3, 8, 6] — Étape 1 : min=1, échange avec 8 → [1, 3, 6, 8]. Étape 2 : min du reste=3, déjà en place → [1, 3, 6, 8]. Attention : [1, 3, 8, 6] serait le résultat si l'échange de 3 et 6 n'avait pas lieu. La liste est [1, 3, 6, 8] après 2 étapes.
Un biais de collecte survient quand :
- A. Les données sont trop volumineuses
- B. L'échantillon ne représente pas fidèlement la population étudiée
- C. La moyenne est différente de la médiane
- D. Les données sont stockées en CSV
Réponse
B. L'échantillon ne représente pas fidèlement la population étudiée — Le biais de collecte (ou d'échantillonnage) apparaît quand la méthode de collecte exclut certains groupes de la population, rendant l'échantillon non représentatif.
Selon le RGPD, une personne peut-elle demander la suppression de ses données personnelles ?
- A. Non, jamais
- B. Oui, c'est le droit à l'effacement
- C. Oui, mais seulement pour les réseaux sociaux
- D. Non, seulement la CNIL peut le faire
Réponse
B. Oui, c'est le droit à l'effacement — Le RGPD consacre le « droit à l'effacement » (ou droit à l'oubli) : toute personne peut demander la suppression de ses données personnelles.
Quelle instruction Python filtre une liste `data` (liste de dicts) pour ne garder que les individus de la ville de Lyon ?
- A. data.filter(ville=Lyon)
- B. [e for e in data if e['ville'] == 'Lyon']
- C. data[ville='Lyon']
- D. filter.data(ville,'Lyon')
Réponse
B. [e for e in data if e['ville'] == 'Lyon'] — En Python, la compréhension de liste [e for e in data if e['ville'] == 'Lyon'] est la syntaxe correcte pour filtrer une liste de dictionnaires.
Quel indicateur statistique est le plus résistant aux valeurs aberrantes ?
- A. Moyenne
- B. Étendue
- C. Médiane
- D. Somme
Réponse
C. Médiane — La médiane est robuste aux outliers car elle ne dépend que de la valeur centrale, contrairement à la moyenne qui est influencée par toutes les valeurs.
Un histogramme diffère d'un diagramme en barres car :
- A. Il utilise des couleurs
- B. Il représente des catégories continues et les barres sont contiguës
- C. Il affiche des pourcentages
- D. Il nécessite un axe vertical
Réponse
B. Il représente des catégories continues et les barres sont contiguës — L'histogramme représente la distribution d'une variable continue (intervalles contigus), tandis que le diagramme en barres compare des catégories discrètes (barres séparées).
Le principe de « minimisation » du RGPD signifie :
- A. Réduire la taille des fichiers
- B. Ne collecter que les données strictement nécessaires à la finalité
- C. Supprimer les données après 1 an
- D. Utiliser des serveurs plus petits
Réponse
B. Ne collecter que les données strictement nécessaires à la finalité — La minimisation impose de ne collecter que les données indispensables à la finalité déclarée du traitement, pas davantage.
En Python, `len([12, 5, 8, 3])` renvoie :
- A. 28
- B. 12
- C. 4
- D. 3
Réponse
C. 4 — len() renvoie le nombre d'éléments de la liste. La liste contient 4 éléments → len() = 4.
Un graphique circulaire (camembert) est inapproprié quand :
- A. On a exactement 4 catégories
- B. On représente des pourcentages
- C. On a plus de 6-7 catégories avec de petites parts
- D. On compare deux années
Réponse
C. On a plus de 6-7 catégories avec de petites parts — Avec trop de catégories, les parts deviennent trop petites pour être lisibles. On préfère alors un diagramme en barres.
Quelle est la différence entre anonymisation et pseudonymisation ?
- A. Ce sont deux mots pour la même chose
- B. L'anonymisation est réversible, la pseudonymisation ne l'est pas
- C. La pseudonymisation est réversible, l'anonymisation est irréversible
- D. L'anonymisation ne supprime pas les données
Réponse
C. La pseudonymisation est réversible, l'anonymisation est irréversible — La pseudonymisation remplace les identifiants par des codes (réversible avec la clé). L'anonymisation supprime définitivement tout lien avec l'individu (irréversible).
Dans un tableau trié, appliquer un filtre puis calculer la moyenne donne-t-il le même résultat que calculer la moyenne puis filtrer ?
- A. Oui, toujours
- B. Non, il faut d'abord trier
- C. Non, l'ordre filtre-puis-calcul est correct ; calculer avant de filtrer porterait sur toutes les données
- D. Oui, car les opérations sont commutatives
Réponse
C. Non, l'ordre filtre-puis-calcul est correct ; calculer avant de filtrer porterait sur toutes les données — Il faut d'abord filtrer les données pour ne conserver que celles qui vérifient la condition, puis calculer la moyenne sur ce sous-ensemble. Calculer d'abord la moyenne sur toutes les données et filtrer ensuite n'a pas de sens.
Que représente la notation $O(n^2)$ pour un algorithme ?
- A. Le nombre d'octets utilisés
- B. Le temps d'exécution croît proportionnellement au carré du nombre de données
- C. L'algorithme s'exécute en exactement n² secondes
- D. L'algorithme utilise n² variables
Réponse
B. Le temps d'exécution croît proportionnellement au carré du nombre de données — La notation $O(n^2)$ (complexité quadratique) indique que le temps d'exécution croît proportionnellement au carré de la taille des données : si n double, le temps est multiplié par 4.
Cours particuliers de sciences numériques et technologie (snt) à Marseille, en présentiel ou à distance — un prof qui s'adapte à ton rythme et reprend ce qui coince.
Soutien scolaire à Marseille · Cours particuliers au lycée · Aide aux devoirs