Welke bedrijfsdata AI-labs kopen, en wat die waard is
Door Nico Vergauwen, oprichter van grokkedGepubliceerd op Bijgewerkt op 6 min lezen
AI-labs betalen voor data die toont hoe werk echt gebeurt: chatgesprekken en e-mailthreads van teams, supporttickets, documenten en contracten, code reviews, CRM-pipelines, procedures en financiële processen. Die data staat niet op het publieke web, dat labs al grotendeels hebben opgebruikt. OpenAI zegt datasets te zoeken die nog niet makkelijk online toegankelijk zijn (OpenAI).
De prijzen zijn echt, maar niet publiek. Gemelde deals voor de werkdata van één bedrijf lopen van $10.000 tot enkele honderdduizenden dollars (Gizmodo, Fortune), en Google won in 2026 een faillissementsveiling voor de e-mails, Teams-chats en bestanden van Spirit Airlines met $10 miljoen. Hieronder: welke datatypes verkopen, waarom private data meer waard is, wat labs betaald hebben en hoe je je eigen data schat.
Kernpunten
- De waardevolste bedrijfsdata toont mensen die echte problemen stap voor stap oplossen: supporttickets, code reviews en incidenten, procedures, en de chat en e-mail eromheen.
- Publieke tekst raakt op. Epoch AI schat de voorraad op ongeveer 300 biljoen tokens en verwacht dat modellen die tussen 2026 en 2032 volledig opgebruikt hebben.
- Labs betaalden ongeveer $60 miljoen per jaar voor de data van Reddit, volgens de pers meer dan $250 miljoen over vijf jaar voor die van News Corp, en $5.000 per boek in een deal met HarperCollins.
- Wat je data opbrengt, hangt af van datatypes, teamgrootte, jaren historiek en sector. De schatting van grokked geeft in 60 seconden een bandbreedte.
De datatypes die AI-labs kopen
Labs trainen modellen om professioneel werk te doen, dus willen ze sporen van professioneel werk. Dit zijn de acht datatypes die grokked in licentie geeft, met de tools waarin ze meestal zitten:
| Data | Voorbeelden | Meestal in | Wat een model ervan leert |
|---|---|---|---|
| Klantenservice | Tickets, chats, helpdeskantwoorden | Zendesk, Freshdesk, Intercom | Hoe echte vragen gediagnosticeerd, beantwoord en geëscaleerd worden |
| Sales & CRM | Pipelines, gespreksnotities, offertes | Salesforce, HubSpot, Pipedrive | Hoe deals gekwalificeerd, geprijsd en onderhandeld worden |
| Code & engineering | Repositories, code reviews, incidenten | GitHub, GitLab, Jira | Hoe software geschreven, gereviewd en hersteld wordt |
| Procedures & SOP’s | Wiki’s, handleidingen, checklists | Confluence, Notion, SharePoint | De stap-voor-stapmethodes van een vak |
| Contracten & documenten | Contracten, rapporten, offertes | Google Drive, Word, DocuSign | Hoe professionele documenten opgebouwd en onderbouwd worden |
| Chat & e-mail | Teamkanalen, e-mailthreads | Slack, Teams, Outlook | Hoe beslissingen in gesprekken genomen worden |
| Financiën & boekhouding | Boekhouding, facturen, bestellingen | Exact, SAP, Odoo | Hoe transacties geboekt, gecontroleerd en afgesloten worden |
| Projecten & taken | Planningen, taken, statusupdates | Asana, monday.com, ClickUp | Hoe werk gepland en opgevolgd wordt |
De veiling van Spirit Airlines toont de vraag. De dataset bevat ongeveer 100 miljoen e-mails, 500 miljoen Teams-chats, 17 miljoen OneDrive-bestanden, meer dan 20 miljoen SharePoint-items en 516 coderepositories, waarbij persoonsgegevens vóór de overdracht verwijderd worden (TechSpot).
Workflowdata telt het zwaarst voor AI-agents. Zoals Fortune schreef, moet een agent leren acties kiezen, tools gebruiken, reageren op tussenresultaten en fouten herstellen (Fortune). Een ticket dat van klacht naar oplossing gaat, of een code review die een bug vangt, toont precies dat.
Waarom private data meer waard is dan publieke data
Het grootste deel van het publieke web is al gebruikt om te trainen. Epoch AI schat de voorraad publieke menselijke tekst van goede kwaliteit op ongeveer 300 biljoen tokens en verwacht dat modellen die tussen 2026 en 2032 volledig opgebruikt hebben (Epoch AI). OpenAI-medeoprichter Ilya Sutskever zei in december 2024 op NeurIPS dat we ‘peak data’ bereikt hebben, omdat er maar één internet is (The Verge).
Labs zoeken dus data die niemand anders heeft. De pagina ‘Data Partnerships’ van OpenAI zegt dat het vooral data zoekt die menselijke bedoelingen uitdrukt, zoals lange teksten of gesprekken in plaats van losse fragmenten (OpenAI). Het privacybeleid van Anthropic noemt niet-publieke datasets van bedrijven als een van zijn trainingsbronnen (Anthropic).
Forbes vatte de verschuiving in augustus 2026 samen: bedrijfsdata is erg nuttig geworden voor AI-training, omdat labs eind 2024 het hele publieke internet al opgezogen hadden (Forbes).
Wat AI-labs voor data betaald hebben
$5.000
per boek in de AI-licentiedeal van HarperCollins, gedeeld met de auteur
Publishers Weekly, 2024Dat zijn de bekendste deals. Andere bekendgemaakte prijzen:
| Verkoper | Koper | Gemelde prijs | Bron |
|---|---|---|---|
| AI-bedrijven | $203M aan datalicentiecontracten over twee à drie jaar | TechCrunch, uit de beursaanvraag van Reddit | |
| Taylor & Francis (Informa) | Microsoft | Meer dan $10M toegangsvergoeding, plus terugkerende betalingen in 2025–2027 | Informa |
| Shutterstock | AI-bedrijven | $104M omzet uit AI-licenties in 2023 | Bloomberg Law |
| Dotdash Meredith | OpenAI | Minstens $16M per jaar | Engadget |
| The New York Times | Amazon | $20M–$25M per jaar | TheWrap |
| News Corp | Meta | Tot $50M per jaar, voor drie jaar | Engadget |
| Spirit Airlines, failliet | $10M op de veiling; Micro1 bood later $12,5M | Fortune | |
| Startups die stoppen | AI-labs en databedrijven | $10.000–$100.000 per bedrijf | Gizmodo |
Deals met uitgevers gaan over publieke content. Bedrijfsdata is een jongere markt: prijzen per bedrijf worden gemeld, niet afgeprijsd, en volgens Fortune bestaat er geen betrouwbaar marktgemiddelde (Fortune).
Wat de data van jouw bedrijf waard kan zijn
De schatting van grokked waardeert elk datatype apart en past die dan aan voor teamgrootte, jaren historiek en sector. De waarde stijgt met het aantal medewerkers, maar minder dan evenredig, en we tellen de meest recente 15 jaar. Data die stap-voor-stapwerk toont, zoals code, supporttickets en procedures, bevat het meeste trainingssignaal per persoon.
| Voorbeeldbedrijf | Data | Geschatte uitbetaling |
|---|---|---|
| Bureau met 20 mensen, 8 jaar | Chat & e-mail, Contracten & documenten, Projecten & taken | €30K–€43K |
| Accountantskantoor met 40 mensen, 20 jaar | Procedures, Contracten & documenten, Chat & e-mail | €72K–€105K |
| Ingenieursbureau met 60 mensen, 15 jaar | Chat & e-mail, Contracten & documenten, Procedures, Projecten & taken | €155K–€225K |
| Softwarebedrijf met 150 mensen, 10 jaar | Code & engineering, Klantenservice, Chat & e-mail, Procedures | €295K–€435K |
| Logistiek bedrijf met 500 mensen, 12 jaar | Klantenservice, Sales & CRM, Procedures, Financiën & boekhouding | €605K–€885K |
Indicatief. Het uiteindelijke bedrag hangt af van volume, kwaliteit en wat kopers betalen. Voor accountants, advocaten en zorgverleners zijn klantdossiers uitgesloten, en daar houdt de schatting al rekening mee.
Je wordt per verkoop betaald. AI-labs bekijken geanonimiseerde samples in onze catalogus en nemen een licentie op je dataset, en je wordt binnen 7 dagen na elke verkoop betaald. Je betaalt nooit iets; grokked neemt een commissie op elke verkoop.
Ontdek wat je data waard is.
Schatting in 60 seconden. Je data aanbieden kost niets.
Wat erbuiten blijft
Sommige data verkoopt nooit, wat een koper ook zou betalen:
- Persoonsgegevens. Namen, e-mailadressen, telefoonnummers, IBAN’s, identiteitsnummers en vergelijkbare identificatoren worden verwijderd voor er iets in licentie gaat (hoe we je data beschermen).
- DM’s en privékanalen, standaard uitgesloten.
- Data die je voor je klanten verwerkt. Ben je verwerker voor je klanten, zoals SaaS-bedrijven vaak zijn, dan komt alleen data in aanmerking waarvoor je bedrijf zelf verantwoordelijk is.
- Klantdossiers in gereglementeerde beroepen. Accountants, advocaten en zorgverleners geven alleen interne knowhow in licentie (details).
- Recent werk. Niets jonger dan 12 maanden, standaard.
Hoe verkopen werkt
- Vraag een schatting. Kies je data, teamgrootte en jaren. 60 seconden.
- Keur de scope goed. Een gesprek van 20 minuten. Jij kiest de kanalen, mappen en periodes.
- Wij anonimiseren en bieden aan. Persoonlijke en vertrouwelijke gegevens worden verwijderd, en geanonimiseerde samples gaan in onze catalogus.
- Labs kopen, jij wordt betaald. AI-labs bekijken je samples en kopen. Je wordt binnen 7 dagen na elke verkoop betaald.
Dat kost je in totaal ongeveer een uur. Je data blijft onder jouw controle tot een koper aankoopt. Kopers krijgen een niet-exclusieve licentie op een geanonimiseerde kopie, en je originelen blijven van jou. Om grokked met andere diensten te vergelijken, lees de beste datamakelaars voor AI-trainingsdata.
Vragen
Welke data kopen AI-bedrijven?
Data die echt werk toont en niet publiek is: chat en e-mail van teams, supporttickets, documenten en contracten, code en code reviews, CRM-gegevens, procedures, financiële en projectdata. OpenAI zoekt bijvoorbeeld datasets die nog niet makkelijk online toegankelijk zijn (OpenAI).
Hoeveel is de data van mijn bedrijf waard voor AI-labs?
Dat hangt af van datatypes, volume, jaren historiek en sector. Gemelde deals voor de werkdata van één bedrijf lopen van $10.000 tot enkele honderdduizenden dollars (Gizmodo, Fortune). De schatting van grokked geeft in 60 seconden een bandbreedte voor jouw bedrijf.
Waarom zou een AI-lab betalen voor Slack-berichten en e-mails?
Gesprekken tonen hoe beslissingen genomen worden en hoe werk gebeurt, iets wat tekst op het publieke web zelden toont. Labs die AI-agents bouwen, hebben voorbeelden nodig van mensen die tools gebruiken, tussenresultaten verwerken en fouten herstellen.
Verlies ik het eigendom van mijn data?
Nee. Kopers krijgen een niet-exclusieve licentie op een geanonimiseerde kopie, om AI-modellen te trainen en te testen. Je originelen verhuizen niet en blijven van jou.
Zitten klant- of personeelsgegevens erin?
Nee. Persoonsgegevens worden verwijderd voor er iets in licentie gaat, DM’s en privékanalen zijn uitgesloten, en data die je voor je klanten verwerkt, blijft erbuiten.
Ontdek wat je data waard is.
Schatting in 60 seconden. Je data aanbieden kost niets.
Bronnen
- OpenAI, 9 november 2023. OpenAI Data Partnerships
- Gizmodo, 17 april 2026. Failed companies are selling old Slack chats and email archives to train AI
- Fortune, 14 september 2026. Little-known AI startup Micro1 tries to trump Google’s bid for bankrupt Spirit Airlines’ data
- TechSpot, 18 augustus 2026. Google pays $10 million for 100 million Spirit Airlines emails and 500 million Teams chats to train AI
- Epoch AI, 6 juni 2024. Will we run out of data to train large language models?
- The Verge, 13 december 2024. OpenAI cofounder Ilya Sutskever predicts the end of AI pre-training
- Anthropic. Non-user privacy policy
- Forbes, 19 augustus 2026. AI companies desperate for data are buying up dead airlines’ emails and scanning old books
- Reuters, 22 februari 2024. Reddit in AI content licensing deal with Google, sources say
- TechCrunch, 22 juni 2024. ‘What’s in it for us?’ journalists ask as publications sign content deals with AI firms
- Publishers Weekly, 19 november 2024. Agents, authors question HarperCollins AI deal
- TechCrunch, 22 februari 2024. Reddit says it’s made $203M so far licensing its data
- Informa, 8 mei 2024. Market update (RNS)
- Bloomberg Law, 4 juni 2024. Shutterstock’s AI-licensing business generated $104 million
- Engadget, 19 november 2024. OpenAI will pay Dotdash Meredith at least $16 million per year to license its content
- TheWrap, 30 juli 2025. New York Times seals $20 million AI deal with Amazon
- Engadget, 3 maart 2026. Meta signs a multimillion dollar AI licensing deal with News Corp
Over de auteur
Nico Vergauwen
Nico Vergauwen is de oprichter van grokked, een datamakelaar die geanonimiseerde interne bedrijfsdata in licentie geeft aan AI-labs. Eigenaars betalen nooit iets en worden binnen 7 dagen na elke verkoop betaald.