DonnéesProjet IAPME

Assez de données pour l'IA ? Le vrai test pour votre PME

Publié le 29 septembre 2026 · 8 min de lecture

« On n'a pas assez de données pour faire de l'IA. » C'est la phrase qu'on entend le plus souvent dans les premiers rendez-vous avec des dirigeants de PME. Souvent, elle est fausse. Parfois, elle est vraie mais pour de mauvaises raisons.

Le mythe du big data a fait des dégâts. Il a convaincu des milliers de dirigeants qu'il fallait des téraoctets pour espérer tirer quelque chose de l'IA. La réalité est plus nuancée, et surtout plus accessible.

D'où vient le mythe des « millions de données »

Quand ChatGPT a explosé en 2023, les médias ont beaucoup parlé des 45 téraoctets d'entraînement de GPT. Le raccourci a été rapide : pour faire de l'IA, il faut être Google.

Sauf que vous n'entraînez pas un modèle de fondation. Vous utilisez un modèle déjà entraîné (Mistral, GPT-4, Claude) et vous le branchez sur vos données métier. Ce sont deux mondes complètement différents.

Dans la vraie vie d'une PME, un projet IA utile démarre souvent avec quelques centaines de documents, un historique CRM de 2-3 ans, ou une base de tickets support. Pas des pétaoctets.

Le vrai test : 5 questions concrètes

Avant de vous demander « combien », posez-vous cinq questions plus utiles.

1. Vos données existent-elles sous forme numérique ?

Ça paraît basique. Ça ne l'est pas. Un cabinet d'expertise-comptable qui a 30 ans d'archives papier n'a pas « des données », il a du stockage. Un artisan qui note ses interventions sur un carnet non plus.

La question n'est pas le volume mais la forme. Un PDF scanné en image, c'est de la donnée dormante. Un PDF avec texte extractible, c'est de la donnée exploitable.

2. Sont-elles centralisées ou éparpillées ?

Une PME de 40 personnes a souvent ses données dans : le CRM, l'ERP, les boîtes mails de 5 commerciaux, un Sharepoint bordélique, un Dropbox partagé, et trois disques durs externes que seul Jean-Michel sait où sont rangés.

Éparpillé ne veut pas dire inutilisable. Mais chaque source à connecter, c'est du temps et du budget. Si vos données sont dans 8 endroits différents, votre projet IA va coûter 3 fois plus cher que si elles sont dans 2 endroits.

3. Sont-elles à jour et cohérentes ?

Une base CRM avec 12 000 contacts dont 40% ont un email obsolète et 20% sont des doublons, c'est pire que 3 000 contacts propres. L'IA va apprendre du bruit et sortir du bruit.

On a récemment travaillé avec une PME du bâtiment qui voulait un agent IA pour qualifier ses leads entrants. Sa base contenait 8 ans d'historique. Après nettoyage : 60% du volume avait disparu, mais la qualité des réponses de l'agent a été multipliée par 4.

4. Avez-vous le droit de les utiliser ?

La question RGPD arrive toujours trop tard dans les projets. Vos données clients ont-elles été collectées avec une finalité compatible ? Vos CV candidats peuvent-ils passer dans une IA ?

Ce n'est pas insurmontable, mais c'est à cadrer dès le départ. Sinon vous découvrez au bout de 3 mois que 40% de votre corpus est inexploitable légalement. On a détaillé la méthode dans notre guide pour auditer son patrimoine de données avant tout projet.

5. Contiennent-elles vraiment l'information que vous cherchez ?

C'est le test qu'on oublie le plus. Vous voulez un agent IA qui prédit le churn client ? Vos données doivent contenir des exemples de clients qui sont partis, avec les signaux précédant leur départ. Si vous n'avez que des données de clients actifs, votre IA n'apprendra rien.

Le volume ne remplace jamais la pertinence. 500 tickets support bien annotés valent mieux que 50 000 tickets sans catégorie.

Combien de données concrètement, selon l'usage

Les ordres de grandeur qu'on observe sur nos projets PME :

Agent IA type RAG (recherche dans vos documents) : 50 à 5 000 documents suffisent largement. C'est le cas d'usage le plus accessible.

Automatisation de tri/classification (mails, tickets, factures) : 500 à 2 000 exemples annotés permettent déjà des résultats corrects. 5 000 pour de la précision élevée.

Analyse prédictive (churn, scoring lead, prévision de ventes) : là il faut du volume et de la profondeur temporelle. Compter 2-3 ans d'historique avec au moins quelques centaines d'événements « positifs » à prédire.

Assistant conversationnel métier : quelques dizaines de FAQ bien écrites + les procédures internes suffisent à démarrer. On enrichit ensuite.

La plupart des projets IA que nous menons en PME rentrent dans les deux premières catégories. Et dans ces cas, la question du volume est rarement bloquante.

Le piège inverse : trop de données mal qualifiées

Paradoxalement, on rencontre plus souvent le problème inverse. Des PME qui ont trop de données, mais tellement mal rangées que le projet devient un chantier de tri avant d'être un chantier IA.

Un cas récent : une ETI industrielle voulait un assistant IA pour ses équipes techniques. On a démarré l'audit sur leur Sharepoint : 340 000 fichiers, dont un tiers en doublons, un quart de brouillons obsolètes, et une nomenclature de dossiers différente par service. Six mois de préparation avant même de commencer l'IA.

La leçon : mieux vaut démarrer petit sur un périmètre propre que gros sur un périmètre pourri. C'est aussi ce qui distingue les projets IA qui aboutissent de ceux qui échouent.

Le vrai signal d'alerte : vous ne savez pas ce que vous avez

Si la question « quelles données avez-vous ? » vous met en difficulté, ce n'est pas un problème d'IA, c'est un problème de gouvernance. Et c'est un excellent point de départ.

Un dirigeant qui ne sait pas où sont ses données, qui y a accès, et à quoi elles servent, va au-devant de problèmes bien plus larges que l'IA : sécurité, conformité, continuité d'activité, valeur de revente de l'entreprise.

Lancer un projet IA est souvent l'occasion de mettre de l'ordre. Beaucoup de nos clients nous disent après coup que le vrai bénéfice n'était pas l'IA elle-même, mais le nettoyage qu'elle a imposé.

Par où commencer si vous doutez

Trois étapes simples avant de vous engager :

  1. Listez 3 cas d'usage que vous aimeriez adresser. Concrets, précis, mesurables.
  2. Identifiez les sources de données liées à chaque cas d'usage. Où elles sont, sous quelle forme, qui les gère.
  3. Évaluez la qualité sur un échantillon. Prenez 100 lignes ou 20 documents au hasard et regardez ce qui est exploitable.

Ce travail prend 2 à 5 jours en interne. Il vous évite d'engager 30 à 80 K€ dans un projet mal calibré. Un bon cadrage en amont via un cahier des charges IA fait la différence entre un projet qui livre et un projet qui s'enlise.

En résumé

Vous avez presque certainement assez de données pour faire de l'IA utile. La vraie question n'est pas « combien », c'est « quelles données, pour quel usage, dans quel état ».

Un projet IA bien cadré démarre souvent avec un corpus modeste mais propre. C'est l'inverse — beaucoup de données mais mal rangées — qui pose les vrais problèmes.

Si vous voulez y voir clair sur votre situation spécifique, on propose un audit gratuit de 30 minutes : on regarde vos cas d'usage, vos données, et on vous dit honnêtement si un projet IA a du sens chez vous, maintenant. Sans blabla, sans devis surprise.

Vous voulez voir ce que ça donnerait chez vous ?

Audit gratuit en 60 minutes. 3 cas d'usage chiffrés en heures et en euros, repartez avec une note claire, même si nous ne travaillons pas ensemble derrière.

Réserver mon audit gratuit →