Notitie · 23 september 2026· 1 min lezen
Jev, Laya en de waarde van kleine AI-beslissingen
Jev, Laya en ons SLOP-onderzoek stellen een simpele vraag: wanneer helpt een besluit, en wanneer moet software twijfel tonen?
Stel je een inbox voor. Er komt een bericht binnen en iemand moet bepalen of het dringend, normaal of onduidelijk is. Een chatbot kan er een keurige alinea over schrijven. Maar misschien is een veel kleiner antwoord nuttiger: een categorie, een reden om te kijken, of gewoon “ik weet het niet”.
Dat is de vraag achter ons vroege SLOP-onderzoek: kunnen kleine, afgebakende beslissingen nuttiger zijn dan nog meer gegenereerde tekst? SLOP is intern onderzoek, geen uitgebracht product en geen bewijs dat we het antwoord al hebben.
Waarom Jev en Laya interessant zijn
TypeSafe beschrijft Jev als een model dat getypeerde vragen over een situatie beantwoordt. De gepubliceerde interface kan onder meer een optie kiezen of een score geven. Het open-source project Laya onderzoekt vergelijkbare beslissingen. Beide laten zien hoe software een smalle vraag kan stellen en een bruikbaar antwoord kan terugkrijgen. Dat zegt nog niets over welke aanpak op onze taken het beste werkt.
De echte proef is minder spectaculair dan een demo: stel dezelfde vraag bij een vaste verzameling voorbeelden, leg de juiste antwoorden vooraf vast, vergelijk met eenvoudige regels en tel de fouten. Bij twijfel moet het systeem iemand kunnen inschakelen in plaats van overtuigd te klinken.
De rol van Bonsai
We testen ook een lokale Bonsai-compatibele route om informatie uit onderzoekspublicaties te halen. Dat is werk aan een onderzoeksproces, geen gewonnen benchmark of systeem dat bij klanten draait. Als bronmateriaal en bewijs dicht bij het experiment blijven, kunnen we beter nagaan waarop een model zijn antwoord baseerde.
Wat we nog moeten uitzoeken
We hebben geen gecontroleerde vergelijking van Jev en Laya op onze eigen taken gepubliceerd. Voor een prestatieclaim zijn een vaste dataset, vooraf bepaalde scores en herhaalbare tests nodig. Misschien winnen gewone regels bij sommige vragen. Ook dat is een waardevol resultaat.
Het doel is niet menselijk oordeel te vervangen door een magische score. We willen leren wanneer een klein antwoord helpt, wanneer het faalt en wanneer een mens aan zet is.
DE POLDERLABS-NIEUWSBRIEF
Interessante ideeën. Af en toe in je inbox.
Nieuwe tools, praktische AI en de keuzes achter software die in de praktijk werkt. Geen ruis; uitschrijven kan altijd.