Verzamelen
Elke bron gaat met checksum, licentie en herkomst het archief in. Ruim een biljoen ruwe tokens, stuk voor stuk herleidbaar.
De meeste AI-leveranciers vragen je hun model te vertrouwen. Wij laten liever zien hoe het gemaakt wordt, van databron tot trainingsrun.
We gebruiken uitsluitend bronnen waarvan herkomst en licentie vastliggen. Filtering op taal, kwaliteit en OCR-ruis gebeurt vóór de training en is net zo controleerbaar als het model zelf.
Internationale modellen knippen Nederlands inefficiënt op. Wij bouwen één 48k-tokenizer voor de hele familie, afgestemd op Nederlands, Engels, code en cijfers.
Polder is geen fine-tune van een buitenlands basismodel. We trainen zelf, langs een ladder van 70M via 350M naar 1B, waarbij elke maat de keuzes voor de volgende valideert.
Elk experiment krijgt een hypothese en een gemeten uitkomst, en ook wat níet werkte leggen we vast. Zo kun je iedere keuze in het model terugvoeren op een meting.
Na de basistraining volgt het echte assistentwerk: instructie-training, voorkeursdata en veiligheid. In het Nederlands, terwijl bestaande datasets vrijwel volledig Engels zijn.
Elke bron passeert eerst de sluis. De sluiswachter kent drie oordelen:
de bron mag het water in én het model mag er open mee de wereld uit
trainbaar, maar een open release wacht tot de licentie is afgetekend
komt het water niet in en traint nooit mee
twijfel is ook een oordeel: zonder heldere licentie wacht een bron bij de sluis · de eu ai act vraagt een publieke samenvatting van trainingsdata en dit register maakt dat bijna een exportknop
Elke bron gaat met checksum, licentie en herkomst het archief in. Ruim een biljoen ruwe tokens, stuk voor stuk herleidbaar.
Taal, kwaliteit en OCR-ruis, per bron gekalibreerd. Wat het niet haalt, wordt gelogd in plaats van stilletjes weggegooid.
Exacte en fuzzy deduplicatie over het hele archief. Pas hierna telt wat er werkelijk bruikbaar is.
PII-detectie met eigen herkenning voor Nederlandse gegevens, van BSN tot adres.
De verhouding tussen Nederlands, Engels, code en wiskunde wordt gemeten in experimenten, niet gegokt.
Elke trainingsrun gedocumenteerd en herhaalbaar, van eerste proefrun tot doelmodel.
Wat op de bodem ligt, wordt het fundament: de familie.
Boven water komen twee dingen: een geteld en gekeurd archief, en een meetlat die iedereen kan narekenen.
het ruwe archief, per domein
totaal · 1.430,0 mld tokens
ruwe archiefschatting (±30%), vóór deduplicatie · na ontdubbeling blijft de kern over: 150–250 miljard unieke Nederlandse tokens
de nederlandse meetstraat
Er bestaat nauwelijks een goede Nederlandse meetlat voor taalmodellen. Daarom bouwen we er zelf één, en die publiceren we samen met de modellen.
Klein is een keuze, geen beperking.
On-device draaien, betaalbaar blijven en goed worden in Nederlands taalwerk: dat is de focus.