Lycée · Terminale · Enseignement scientifique
Données et algorithmes
Du recueil des données numériques aux algorithmes d'apprentissage : comment l'exploitation des données fonde l'intelligence artificielle — thème « Une histoire du vivant : les entreprises et l'intelligence artificielle » (programme d'enseignement scientifique de Tle générale)
À propos de cette page
La donnée numérique : nature, codage et contexte
Une donnée est une information brute : un nombre, un mot, une couleur de pixel, une position GPS, un « j'aime »… Dans un ordinateur, toute donnée est numérique : elle est codée in fine en binaire, c'est-à-dire sous forme de suites de 0 et de 1 (les bits).
Une donnée isolée a peu de sens : elle doit être replacée dans un contexte et accompagnée de métadonnées (données qui décrivent la donnée : date, lieu, format, auteur…).
Du recueil au stockage : la croissance des données (big data)
Nos activités numériques (capteurs, smartphones, réseaux sociaux, objets connectés, transactions) produisent un volume colossal de données. On parle de mégadonnées ou big data.
Les unités de stockage suivent une progression par puissances de 1000 (ou 1024 en informatique) : l'octet, le kilooctet (ko, ≈ 10³ octets), le mégaoctet (Mo, ≈ 10⁶), le gigaoctet (Go, ≈ 10⁹), le téraoctet (To, ≈ 10¹²), le pétaoctet (Po, ≈ 10¹⁵).
Qu'est-ce qu'un algorithme ?
Une fois les données disponibles, encore faut-il les traiter. C'est le rôle des algorithmes.
Un algorithme repose sur quelques briques de base : des instructions exécutées dans l'ordre, des conditions (si… alors… sinon), des boucles (répéter tant que…) et des variables pour stocker des valeurs.
Efficacité d'un algorithme : la question de la complexité
Pour un même problème, plusieurs algorithmes existent : certains sont beaucoup plus rapides que d'autres. On évalue l'efficacité d'un algorithme par sa complexité : le nombre d'opérations qu'il effectue selon la taille $n$ des données.
L'apprentissage automatique : apprendre à partir des données
Les algorithmes classiques suivent des règles écrites à l'avance par un programmeur. Mais pour certaines tâches (reconnaître un visage, traduire une phrase), il est impossible d'énumérer toutes les règles. On utilise alors l'apprentissage automatique (machine learning), branche de l'intelligence artificielle.
Plus les données d'entraînement sont nombreuses et variées, plus le modèle est performant : c'est pourquoi le big data et l'IA progressent ensemble. L'apprentissage se déroule en deux temps : une phase d'entraînement (le modèle ajuste ses paramètres sur les données) puis une phase d'utilisation (le modèle traite de nouvelles données jamais vues).
L'apprentissage supervisé et ses applications
La forme la plus courante d'apprentissage est l'apprentissage supervisé.
| Type d'apprentissage | Données fournies | Exemple de tâche |
|---|---|---|
| Supervisé | Exemples étiquetés (entrée + bonne réponse) | Reconnaître un chiffre manuscrit, filtrer les spams |
| Non supervisé | Données sans étiquette | Regrouper des clients par profils similaires |
La qualité et la quantité des données étiquetées déterminent directement la performance du modèle : un modèle entraîné sur des données insuffisantes ou de mauvaise qualité fera de mauvaises prédictions.
Les systèmes de recommandation et le ciblage
Une application majeure des algorithmes d'apprentissage est le système de recommandation, omniprésent dans les plateformes commerciales (achats, vidéos, musique, réseaux sociaux).
Ces systèmes reposent sur la collecte massive de données personnelles : ils sont au cœur du modèle économique de nombreuses entreprises (publicité ciblée). Le ciblage permet d'adresser à chaque personne un contenu ou une publicité adaptés à son profil.
Données, algorithmes et société : enjeux et limites
Le couple données–algorithmes transforme l'économie et la société, mais soulève d'importants enjeux éthiques, sociaux et environnementaux.
| Enjeu | Description |
|---|---|
| Vie privée | Collecte et exploitation de données personnelles ; encadrement par le RGPD en Europe. |
| Biais des données | Un modèle entraîné sur des données biaisées reproduit, voire amplifie, ces biais (discriminations). |
| Transparence | Certains algorithmes sont des « boîtes noires » : leurs décisions sont difficiles à expliquer. |
| Environnement | L'entraînement des modèles et le stockage des données consomment beaucoup d'énergie. |
| Bulles de filtre | Les recommandations enferment l'utilisateur dans ses propres goûts et opinions. |
- Une donnée numérique est une information codée en binaire (0 et 1) ; elle prend sens avec son contexte et ses métadonnées.
- Le big data (Volume, Vélocité, Variété) explose : les unités vont de l'octet au pétaoctet (× 1000 à chaque palier).
- Un algorithme est une suite finie d'instructions qui transforme des données d'entrée en sortie ; son efficacité se mesure par sa complexité (ex. dichotomie en $\log_2 n$ contre recherche séquentielle en $n$).
- L'apprentissage automatique construit un modèle à partir d'exemples ; en apprentissage supervisé, les données sont étiquetées. Plus de données ⇒ meilleur modèle (jusqu'à un plafond).
- Les systèmes de recommandation exploitent les données personnelles pour cibler contenus et publicités (modèle économique).
- Données et algorithmes posent des enjeux : vie privée (RGPD), biais des données, transparence, coût environnemental, bulles de filtre. Un algorithme n'est jamais neutre.
Cours particuliers de enseignement scientifique à Marseille, en présentiel ou à distance — un prof qui s'adapte à ton rythme et reprend ce qui coince.
Soutien scolaire à Marseille · Cours particuliers au lycée · Aide aux devoirs