Quelles données d’entreprise les labos d’IA achètent, et ce qu’elles valent
Par Nico Vergauwen, fondateur de grokkedPublié le Mis à jour le 7 min de lecture
Les laboratoires d’IA paient pour des données qui montrent comment le travail se fait réellement : fils de discussion et e-mails d’équipe, tickets de support, documents et contrats, revues de code, pipelines CRM, procédures et flux financiers. Ces données ne sont pas sur le web public, que les laboratoires ont déjà largement épuisé. OpenAI indique rechercher des jeux de données qui ne sont pas déjà facilement accessibles en ligne (OpenAI).
Les prix sont réels mais pas publics. Les montants rapportés pour les données internes d’une entreprise vont de 10 000 dollars à plusieurs centaines de milliers de dollars (Gizmodo, Fortune), et Google a remporté en 2026 la vente aux enchères des e-mails, conversations Teams et fichiers de Spirit Airlines, en faillite, pour 10 millions de dollars. Ci-dessous : les types de données qui se vendent, pourquoi les données privées valent plus, ce que les laboratoires ont payé et comment estimer les vôtres.
À retenir
- Les données d’entreprise les plus précieuses montrent des gens qui résolvent de vrais problèmes étape par étape : tickets de support, revues de code et incidents, procédures, et les échanges de messagerie et d’e-mails qui les entourent.
- Le texte public s’épuise. Epoch AI l’estime à environ 300 000 milliards de tokens et prévoit qu’il sera entièrement utilisé entre 2026 et 2032.
- Les laboratoires ont payé environ 60 millions de dollars par an pour les données de Reddit, plus de 250 millions sur cinq ans selon la presse pour celles de News Corp, et 5 000 dollars par livre dans un accord avec HarperCollins.
- Ce que rapportent vos données dépend des types de données, de la taille de l’équipe, de l’historique et du secteur. L’estimateur de grokked donne une fourchette en 60 secondes.
Les types de données que les labos d’IA achètent
Les laboratoires entraînent des modèles à effectuer un travail professionnel ; ils veulent donc des traces de travail professionnel. Voici les huit types de données que grokked concède sous licence, avec les outils où ils se trouvent habituellement :
| Données | Exemples | Généralement dans | Ce qu’un modèle en apprend |
|---|---|---|---|
| Support client | Tickets, chats, réponses du support | Zendesk, Freshdesk, Intercom | Comment de vraies questions sont diagnostiquées, traitées et escaladées |
| Ventes & CRM | Pipelines, notes d’appel, propositions | Salesforce, HubSpot, Pipedrive | Comment les affaires sont qualifiées, chiffrées et négociées |
| Code & ingénierie | Dépôts, revues de code, incidents | GitHub, GitLab, Jira | Comment un logiciel est écrit, relu et corrigé |
| Procédures & modes opératoires | Wikis, manuels, checklists | Confluence, Notion, SharePoint | Les méthodes pas à pas d’un métier |
| Contrats & documents | Contrats, rapports, offres | Google Drive, Word, DocuSign | Comment les documents professionnels sont structurés et argumentés |
| Messagerie & e-mails | Canaux d’équipe, fils d’e-mails | Slack, Teams, Outlook | Comment les décisions se prennent dans la conversation |
| Finance & comptabilité | Comptabilité, factures, commandes | Exact, SAP, Odoo | Comment les opérations sont enregistrées, contrôlées et clôturées |
| Projets & tâches | Plannings, tâches, points d’avancement | Asana, monday.com, ClickUp | Comment le travail est planifié et suivi dans le temps |
La vente aux enchères de Spirit Airlines montre l’appétit du marché. Le jeu de données comprend environ 100 millions d’e-mails, 500 millions de conversations Teams, 17 millions de fichiers OneDrive, plus de 20 millions d’éléments SharePoint et 516 dépôts de code, les informations personnelles étant retirées avant le transfert (TechSpot).
Les données de flux de travail comptent surtout pour les agents d’IA. Comme l’écrit Fortune, un agent doit apprendre à choisir des actions, utiliser des outils, réagir aux résultats intermédiaires et corriger ses erreurs (Fortune). Un ticket qui va de la plainte à la solution, ou une revue de code qui repère un bug, montre exactement cela.
Pourquoi les données privées valent plus que les données publiques
L’essentiel du web public a déjà servi à l’entraînement. Epoch AI estime le stock de texte public humain de qualité à environ 300 000 milliards de tokens et prévoit que les modèles l’auront entièrement utilisé entre 2026 et 2032 (Epoch AI). En décembre 2024, Ilya Sutskever, cofondateur d’OpenAI, a déclaré à la conférence NeurIPS que nous avions atteint le « pic des données », puisqu’il n’existe qu’un seul internet (The Verge).
Les laboratoires cherchent donc des données que personne d’autre n’a. La page « Data Partnerships » d’OpenAI précise qu’elle recherche en particulier des données qui expriment une intention humaine, comme des textes longs ou des conversations plutôt que des extraits isolés (OpenAI). La politique de confidentialité d’Anthropic cite parmi ses sources d’entraînement des jeux de données non publics obtenus auprès d’entreprises (Anthropic).
Forbes résumait le basculement en août 2026 : les données d’entreprise sont devenues très utiles pour l’entraînement de l’IA, car les laboratoires avaient déjà aspiré tout l’internet public fin 2024 (Forbes).
Ce que les labos d’IA ont payé pour des données
5 000 $
par livre dans l’accord de licence IA de HarperCollins, partagés avec l’auteur
Publishers Weekly, 2024Ce sont les accords phares. Autres prix publiés :
| Vendeur | Acheteur | Prix rapporté | Source |
|---|---|---|---|
| Entreprises d’IA | 203 M$ de contrats de licence de données sur deux à trois ans | TechCrunch, d’après le dossier d’introduction en bourse de Reddit | |
| Taylor & Francis (Informa) | Microsoft | Plus de 10 M$ de droit d’accès, plus des paiements récurrents en 2025–2027 | Informa |
| Shutterstock | Entreprises d’IA | 104 M$ de revenus de licences IA en 2023 | Bloomberg Law |
| Dotdash Meredith | OpenAI | Au moins 16 M$ par an | Engadget |
| The New York Times | Amazon | 20 à 25 M$ par an | TheWrap |
| News Corp | Meta | Jusqu’à 50 M$ par an, sur trois ans | Engadget |
| Spirit Airlines, en faillite | 10 M$ aux enchères ; Micro1 a ensuite proposé 12,5 M$ | Fortune | |
| Startups en fermeture | Labos d’IA et sociétés de données | 10 000 à 100 000 $ par entreprise | Gizmodo |
Les accords avec les éditeurs portent sur des contenus publics. Les données d’entreprise forment un marché plus récent : les prix par entreprise sont rapportés, pas affichés, et Fortune notait qu’il n’existe aucune moyenne fiable (Fortune).
Ce que les données de votre entreprise peuvent valoir
L’estimateur de grokked évalue chaque type de données séparément, puis ajuste selon la taille de l’équipe, l’historique et le secteur. La valeur augmente avec les effectifs, mais moins que proportionnellement, et nous retenons les 15 années les plus récentes. Les données qui montrent un travail pas à pas, comme le code, les tickets de support et les procédures, portent le plus de signal d’entraînement par personne.
| Exemple d’entreprise | Données | Paiement estimé |
|---|---|---|
| Agence de 20 personnes, 8 ans | Messagerie & e-mail, Contrats & documents, Projets & tâches | 30 k€–43 k€ |
| Cabinet comptable de 40 personnes, 20 ans | Procédures, Contrats & documents, Messagerie & e-mail | 72 k€–105 k€ |
| Bureau d’ingénierie de 60 personnes, 15 ans | Messagerie & e-mail, Contrats & documents, Procédures, Projets & tâches | 155 k€–225 k€ |
| Éditeur de logiciels de 150 personnes, 10 ans | Code & ingénierie, Support client, Messagerie & e-mail, Procédures | 295 k€–435 k€ |
| Entreprise logistique de 500 personnes, 12 ans | Support client, Ventes & CRM, Procédures, Finance & comptabilité | 605 k€–885 k€ |
Indicatif. Le montant final dépend du volume, de la qualité et de ce que paient les acheteurs. Pour les experts-comptables, avocats et professionnels de santé, les dossiers clients sont exclus, et l’estimation en tient déjà compte.
Vous êtes payé à chaque vente. Les laboratoires d’IA consultent des échantillons anonymisés dans notre catalogue et acquièrent une licence sur votre jeu de données ; vous êtes payé sous 7 jours après chaque vente. Vous ne payez jamais rien ; grokked prend une commission sur chaque vente.
Découvrez la valeur de vos données.
Estimation en 60 secondes. Référencer vos données ne coûte rien.
Ce qui reste exclu
Certaines données ne se vendent jamais, quel que soit le prix proposé :
- Les données personnelles. Noms, adresses e-mail, numéros de téléphone, IBAN, numéros d’identification et identifiants similaires sont retirés avant toute licence (comment nous protégeons vos données).
- Les messages privés et canaux privés, exclus par défaut.
- Les données que vous traitez pour vos clients. Si vous êtes sous-traitant de vos clients, comme le sont souvent les éditeurs SaaS, seules les données dont votre entreprise est responsable sont éligibles.
- Les dossiers clients des professions réglementées. Les experts-comptables, avocats et professionnels de santé ne concèdent que leur savoir-faire interne (détails).
- Le travail récent. Rien de moins de 12 mois, par défaut.
Comment se passe la vente
- Obtenez une estimation. Choisissez vos données, la taille de l’équipe et l’ancienneté. 60 secondes.
- Validez le périmètre. Un appel de 20 minutes. Vous choisissez les canaux, dossiers et périodes.
- Nous anonymisons et référençons. Les informations personnelles et confidentielles sont retirées, et des échantillons anonymisés rejoignent notre catalogue.
- Les labos achètent, vous êtes payé. Les laboratoires d’IA consultent vos échantillons et achètent. Vous êtes payé sous 7 jours après chaque vente.
Cela représente environ une heure de votre temps au total. Vos données restent sous votre contrôle jusqu’à l’achat. Les acheteurs obtiennent une licence non exclusive sur une copie anonymisée, et vos originaux restent à vous. Pour comparer grokked aux autres services, lisez les meilleurs courtiers en données d’entraînement IA.
Questions
Quelles données les entreprises d’IA achètent-elles ?
Des données qui montrent un vrai travail et qui ne sont pas publiques : messagerie et e-mails d’équipe, tickets de support, documents et contrats, code et revues de code, données CRM, procédures, données financières et de projets. OpenAI, par exemple, recherche des jeux de données qui ne sont pas déjà facilement accessibles en ligne (OpenAI).
Combien valent les données de mon entreprise pour les labos d’IA ?
Cela dépend des types de données, du volume, de l’historique et du secteur. Les montants rapportés pour les données internes d’une entreprise vont de 10 000 dollars à plusieurs centaines de milliers de dollars (Gizmodo, Fortune). L’estimateur de grokked donne une fourchette pour votre entreprise en 60 secondes.
Pourquoi un labo d’IA paierait-il pour des messages Slack et des e-mails ?
Les conversations montrent comment les décisions se prennent et comment le travail se fait, ce que le texte du web public montre rarement. Les laboratoires qui développent des agents d’IA ont besoin d’exemples de personnes qui utilisent des outils, traitent des résultats intermédiaires et corrigent leurs erreurs.
Est-ce que je perds la propriété de mes données ?
Non. Les acheteurs obtiennent une licence non exclusive sur une copie anonymisée, pour entraîner et évaluer des modèles d’IA. Vos originaux ne bougent pas et restent à vous.
Les données des clients ou des salariés sont-elles incluses ?
Non. Les données personnelles sont retirées avant toute licence, les messages et canaux privés sont exclus, et les données que vous traitez pour le compte de vos clients restent hors périmètre.
Découvrez la valeur de vos données.
Estimation en 60 secondes. Référencer vos données ne coûte rien.
Sources
- OpenAI, 9 novembre 2023. OpenAI Data Partnerships
- Gizmodo, 17 avril 2026. Failed companies are selling old Slack chats and email archives to train AI
- Fortune, 14 septembre 2026. Little-known AI startup Micro1 tries to trump Google’s bid for bankrupt Spirit Airlines’ data
- TechSpot, 18 août 2026. Google pays $10 million for 100 million Spirit Airlines emails and 500 million Teams chats to train AI
- Epoch AI, 6 juin 2024. Will we run out of data to train large language models?
- The Verge, 13 décembre 2024. OpenAI cofounder Ilya Sutskever predicts the end of AI pre-training
- Anthropic. Non-user privacy policy
- Forbes, 19 août 2026. AI companies desperate for data are buying up dead airlines’ emails and scanning old books
- Reuters, 22 février 2024. Reddit in AI content licensing deal with Google, sources say
- TechCrunch, 22 juin 2024. ‘What’s in it for us?’ journalists ask as publications sign content deals with AI firms
- Publishers Weekly, 19 novembre 2024. Agents, authors question HarperCollins AI deal
- TechCrunch, 22 février 2024. Reddit says it’s made $203M so far licensing its data
- Informa, 8 mai 2024. Market update (RNS)
- Bloomberg Law, 4 juin 2024. Shutterstock’s AI-licensing business generated $104 million
- Engadget, 19 novembre 2024. OpenAI will pay Dotdash Meredith at least $16 million per year to license its content
- TheWrap, 30 juillet 2025. New York Times seals $20 million AI deal with Amazon
- Engadget, 3 mars 2026. Meta signs a multimillion dollar AI licensing deal with News Corp
L’auteur
Nico Vergauwen
Nico Vergauwen est le fondateur de grokked, un courtier en données qui concède sous licence les données internes anonymisées d’entreprises à des laboratoires d’IA. Les propriétaires ne paient jamais rien et sont payés sous 7 jours après chaque vente.