TypeSafe bracht op 15 september Jev uit, een model dat iets doet wat de meeste AI-modellen juist niet doen: het schrijft niets. Je geeft het een situatie en een vraag, en je krijgt een getal terug. Een kans tussen nul en een, een keuze uit een vaste lijst, of een score op een schaal die jij hebt gedefinieerd. Geen alinea, geen uitleg, geen "Natuurlijk! Hier is je antwoord:".
Dat klinkt als een beperking. In de praktijk is het precies wat veel bedrijfsprocessen nodig hebben.
De meeste AI-koppelingen die wij bij MKB-bedrijven tegenkomen doen hetzelfde: er komt iets binnen, een taalmodel bekijkt het, en er rolt tekst uit. Dat werkt, maar er zitten twee vervelende kanten aan.
De eerste is dat je een beslissing uit tekst moet zien te vissen. Je vraagt "is deze klantmail urgent, antwoord met ja of nee" en krijgt terug: "Ja, deze e-mail lijkt urgent omdat de klant aangeeft al drie dagen te wachten." Nu mag je programmeren dat er ergens "ja" in staat. Dat gaat 95 van de 100 keer goed, en die 5 keer moet je opvangen.
De tweede is de prijs en de wachttijd. Een frontier model kost al snel enkele dollars per miljoen tokens en denkt een paar seconden na. Als je dat over elk binnenkomend bericht, elke productreview en elke formulierinzending heen haalt, tikt dat aan.
Jev pakt dit van de andere kant aan. Je definieert vooraf welke vorm het antwoord heeft, en het model vult die vorm in. TypeSafe noemt het percentage structuurfouten "0% (by construction)", oftewel: het kan niet anders antwoorden dan in het formaat dat jij hebt opgegeven. Volgens de aankondiging reageert het in 70 tot 500 milliseconden en kost het 0,042 dollar per miljoen invoertokens, waarbij output gratis is.
Er zijn drie vraagtypen. Noul is een ja/nee-vraag die een kans teruggeeft, bijvoorbeeld 0,93. Choice laat het model kiezen uit maximaal 255 opties en geeft de kansverdeling over alle opties mee. Score plaatst een oordeel op een schaal van 2 tot 10 niveaus die jij beschrijft, en de uitkomst mag tussen niveaus in landen. Bij choice en score krijg je een betrouwbaarheidswaarde terug.
Dat laatste is het interessantste onderdeel. Het model liegt niet over zijn eigen zekerheid. Als het twijfelt, zie je een vlakke kansverdeling en een lage confidence. Daar kun je in code op sturen.
Wij hebben Jev deze week zelf in gebruik genomen, op onze eigen nieuwspagina. Die pagina haalt automatisch bronnen op en schrijft daar artikelen over. Het probleem was niet de techniek maar de smaak: er kwamen artikelen uit over software-updates van pdf-programma's en over nieuwe voetbalfuncties in Google Search. Niet bepaald zaken waar een ondernemer wakker van ligt.
Nu beoordeelt Jev elk kandidaat-onderwerp op drie punten voordat er iets geschreven wordt: is dit echt nieuws, hoe relevant is het voor een Nederlandse ondernemer, en is het eigenlijk gewoon reclame. Dat eerste pdf-bericht kreeg een score van 0,09 op "is dit echt nieuws". Een handvol vendor-blogs kreeg 0,85 tot 0,96 op "dit is marketing". Die gaan er nu uit voordat we een cent aan schrijfkosten maken. Die hele beoordeling kostte 44 uitvoertokens.
Daarna gebruiken we het nog een keer, en dat is voor ons de belangrijkste toepassing: controleren of het geschreven artikel wel klopt met de bron. We testten dat met een artikel waarin wij expres een verzonnen prijs, een verzonnen klantaantal en een niet-bestaande directeur hadden gezet. Het echte artikel scoorde 0,98 op "gegrond in de bron" en 0,03 op "bevat verzonnen details". Het vervalste artikel scoorde 0,01 en 0,99. Geen twijfel mogelijk.
Dat patroon is breder toepasbaar dan alleen bij nieuwsartikelen. Overal waar een AI tekst produceert die naar een klant gaat, kun je er voor een fractie van de kosten een tweede model naast zetten dat controleert of de beweringen ergens op gebaseerd zijn.
Een paar toepassingen die wij direct bruikbaar vinden voor Nederlandse MKB-bedrijven:
Inkomende mail sorteren. De belangrijkste toepassing wat ons betreft, dus die werken we hieronder helemaal uit.
Retouraanvragen beoordelen. Een webshop met veel retouren kan per aanvraag laten scoren hoe waarschijnlijk het is dat het binnen de voorwaarden valt, en hoe boos de klant is. Bij hoge zekerheid en een keurige aanvraag gaat het automatisch door, bij twijfel of een oplopende toon komt er een mens aan te pas. Dat is de confidence-drempel als gereedschap: laag voor onschuldige acties, hoog voor alles wat geld kost.
Productinformatie controleren. Wie een catalogus van duizenden producten van leveranciers binnenkrijgt, weet dat teksten en categorieën rammelen. Jev kan per product beoordelen of de omschrijving bij de categorie past, of er verboden claims in staan, en of de tekst compleet genoeg is om te publiceren. Het artikel noemt een voorbeeld waarin 1.018 wetenschappelijke papers werden geclassificeerd voor 0,08 dollar in totaal.
Leads kwalificeren. Wij gebruiken hetzelfde principe voor onze eigen acquisitie: past dit bedrijf bij wat wij doen, is het een concurrent, is de website echt achterstallig. Dat scheelt uren doorklikken.
AI-uitvoer bewaken. Draait er al een chatbot of een tekstgenerator in je bedrijf? Zet er een controle achter die kijkt of het antwoord binnen de bedrijfsregels blijft en of er geen toezeggingen worden gedaan over prijzen of levertijden die niemand kan waarmaken.
Neem het adres waar bij vrijwel elk bedrijf alles binnenkomt: info@. Daar landt spam, cold outreach van SEO-bureaus, nieuwsbrieven waar ooit iemand zich voor heeft aangemeld, facturen, en ergens daartussen een klant die betaald heeft en niets heeft ontvangen.
Dat laatste bericht is het enige dat vandaag nog beantwoord moet worden. De rest kan wachten of kan weg. Maar als eenmanszaak ga je niet elke mail uitpluizen, en juist daarom glipt die ene erdoorheen. Een klant die twee weken niets hoort vraagt zijn geld terug via de bank, laat een review achter, en komt niet meer terug.
Wij hebben dit vanmiddag getest met drie realistische berichten en precies de vragen die je hiervoor zou stellen: hoe snel moet hier op gereageerd worden, wat voor soort bericht is dit, en heeft deze persoon betaald zonder iets te ontvangen. Dit kwam eruit:
Klant met bestelling 48123, betaald op 8 september, niets ontvangen, dreigt met terugboeking via de bank. Spoed 3,99 op een schaal waar 4 staat voor "vandaag, klant heeft al geld betaald of dreigt weg te lopen". Soort: klantprobleem, met 100% zekerheid. Betaald zonder levering: 0,96. Oftewel: bovenaan, vandaag nog.
SEO-bureau dat belooft je binnen 30 dagen op pagina 1 te krijgen, nu met 50% korting. Spoed 0,00, soort marketing met 88% zekerheid. Nooit reageren.
Aannemersbedrijf uit Zoetermeer, 12 medewerkers, site uit 2016 die slecht werkt op mobiel, vraagt om een indicatie van kosten. Spoed 2,89, oftewel binnen 24 uur. Soort: nieuwe aanvraag, 100% zeker. Dit is gewoon een lead, en die verdient morgen een antwoord.
Elk van die beoordelingen kostte rond de 660 tokens. Bij 0,042 dollar per miljoen tokens betekent dat: duizend mails per maand beoordelen kost je ongeveer drie cent. Niet drie euro. Drie cent.
Het aardige is dat je hier geen enkele mail voor hoeft te laten schrijven door AI. Je laat alleen sorteren. De mails met een hoge spoedscore krijgen een label of komen in een aparte map, de marketingmails gaan naar een map die je een keer per week doorkijkt, en je begint je dag met de drie berichten die er echt toe doen in plaats van met scrollen door zestig.
Belangrijk daarbij: laat het systeem niet automatisch antwoorden. Een verkeerd gesorteerde mail kost je vijf seconden om terug te slepen, een verkeerd automatisch antwoord aan een boze klant kost je die klant. Sorteren is veilig, antwoorden niet. Wil je toch een stap verder, laat het systeem dan een concept klaarzetten dat jij nog goedkeurt.
Twee dingen om op te letten als je dit bouwt. Spam en phishing zijn niet hetzelfde: een nepfactuur die eruitziet als een echte moet niet in de map "reclame" belanden, dus dat is een aparte vraag waard. En stuur niet je hele mailbox mee als context, maar alleen afzender, onderwerp en de eerste paar alinea's. Dat is goedkoper, nauwkeuriger, en vanuit de AVG een stuk beter te verdedigen.
Eerlijk is eerlijk, er zitten flinke haken aan.
Jev leest letterlijk. Ontkenningen en woorden als "behalve" of "alleen als" neemt hij op hun woord, dus vragen die slim geformuleerd zijn werken slechter dan vragen die saai en direct zijn. Hij kan niet rekenen en niet betrouwbaar tellen. Data als volgorde begrijpt hij slecht. En hij wordt merkbaar minder nauwkeurig als je hem veel irrelevante informatie meegeeft, wat het artikel "context rot" noemt. Er zit een limiet van 64.000 tokens op de situatie en alle vragen samen.
De belangrijkste regel uit het artikel is wat ons betreft deze: vraag het model niets wat je code exact kan uitrekenen, en stop niet meerdere oordelen in één vraag. Als je wilt weten of een order zowel te laat is als boven de duizend euro, dan is dat een som en een vergelijking, geen AI-vraag.
Ook de gepubliceerde nauwkeurigheidscijfers verdienen een kanttekening. TypeSafe meldt 67,8% tegenover 74,1% voor het sterkste vergelijkingsmodel, maar die score meet overeenstemming met twee andere AI-modellen, niet of de antwoorden feitelijk juist zijn. Het is bovendien de aanbieder zelf die meet. Onze eigen ervaring van deze week was positief, maar dat zijn een paar dozijn beoordelingen, geen bewijs.
Begin bij je info-adres. Tel een week lang hoeveel mails daar binnenkomen en hoeveel daarvan er echt toe deden. Die verhouding is je businesscase. Kijk daarbij vooral of er iets tussen zat dat je te laat hebt gezien, want dat is wat dit oplost: niet de tijd die het sorteren kost, maar de klant die je bijna kwijt was.
Begin met een proces waar een fout niet fataal is. Sorteren en prioriteren is een prima start, want de verkeerde volgorde kost tijd en geen geld. Automatisch geld terugstorten is dat niet. Bouw de drempel zo dat het systeem bij twijfel naar een mens gaat, en houd bij hoe vaak dat gebeurt.
Zet een controle achter de AI die je al gebruikt. Als er nu al automatisch tekst naar klanten gaat, is een grondingscontrole de goedkoopste verzekering die je kunt afsluiten. In ons geval was het verschil tussen een kloppend en een verzonnen artikel 0,98 tegenover 0,01, en die controle kost je een fractie van een cent.
Wil je weten welke keuzes in jouw bedrijf hiervoor in aanmerking komen? Loop je processen een keer met ons door. Wij hebben het deze week op onze eigen site gebouwd, inclusief de tegenvallers, dus we weten aardig waar het schuurt.
Remco
Founder, Rebus
Remco bouwt maatwerk websites, webshops en SEO-strategieën voor MKB door heel Nederland. Rebus is zijn solo-studio in Den Haag.
LinkedIn →Klaar om te bouwen?
Laten we jouw project bespreken
Geen salesgesprek. Gewoon kijken of er een match is en wat je kunt verwachten.
Gesprek plannen →