door Willem Brouwer,
18
september
2024
|
16:11
Europe/Amsterdam

Bijzonder AI-model afgerond: ‘Onze dataset is de grootste ter wereld’

Download

Daar zitten de mannen, glunderend van trots. Het zijn Gerard Schouten, lector AI & Data, en onderzoeker Bas Michielsen. Hun vier jaar durend onderzoek, de ontwikkeling van een open source AI-model dat zo’n 50 soorten wilde bloemen kan herkennen en tellen, is afgerond. Evenals de bijbehorende publicatie. “We zijn al bezig met projectaanvragen.”

Met name Schouten steekt zijn gevoelens niet onder stoelen of banken. “Supertrots, ja echt.” Hij kijkt zijn compagnon Michielsen aan, die ietwat verlegen teruglacht. Schouten: “We hebben onderzoek gedaan naar hoe je met behulp van AI de biodiversiteit van wilde bloemen in Nederland kunt meten. In wegbermen, grasland, parkjes in steden, mooie weilanden langs de Dommel”, zo somt hij op.

Gerard (l) en BasZe verzamelden 2.000 beelden in een hoge resolutie in en rondom Eindhoven, gemaakt met een drone of een moderne smartphone. Daarmee trainden Schouten en Michielsen het AI-model: zonder data is er immers geen model dat al die bloemen kan tellen en een naam kan geven.

Trial-and-error 
Het ontwikkelen van dit model ligt in handen van Michielsen. Hij windt er geen doekjes om: met name de opstartperiode was het trial-and-error wat de klok sloeg. “Gewoon aan de gang gaan met die data en kijken wat er gebeurt. Al ging daar óók weer veel werk aan vooraf.” Schouten wilde namelijk een kwalitatief hoogstaande dataset.

Daarvoor namen ze maatregelen. Zo moest AI-bias te allen tijde voorkomen worden. Dat verwijst naar de systematische en oneerlijke vooroordelen die kunnen ontstaan in AI-systemen. “Dat hebben we er volledig uit kunnen halen. "Superbelangrijk", vertelt Schouten, die daaraan toevoegt dat op die grote collectie foto’s 65.000 annotaties en 160 bloemsoorten te zien zijn. Deze geannoteerde dataset is voor iedereen beschikbaar gesteld en heet Eindhoven Wildflower Dataset.

“Uit de grote set is een deelset van vijftig soorten gemaakt die helemaal uitgebalanceerd is. Dit hebben we gedaan om te voorkomen dat het model gaat ‘discrimineren’. Simpeler gezegd: om te vermijden dat het model de ene bloemsoort voortrekt ten opzichte van de andere. Michielsen heeft dat puzzelwerk geweldig gedaan”, complimenteert hij zijn compagnon. En voegt er nog snel aan toe: “We hopen dat andere onderzoekers onze dataset gaan gebruiken om nog betere modellen te maken.”

De grootste ter wereld 
Bachelor- en masterstudenten van Fontys ICT en biologiestudenten van de HAS en Universiteit Leiden deden belangrijk voorwerk”, vertelt Schouten. Ook Naturalis, en in het bijzonder Barbara Gravendeel, mag volgens het tweetal niet onvermeld gelaten worden. “Zij is een van dé botanische experts van Nederland en heeft met haar domeinkennis bijgedragen aan dit project."

Nu willen de mannen maatschappelijk het verschil maken door biodiversiteit te monitoren met kunstmatige intelligentie. “AI is betrouwbaarder, goedkoper en sneller in vergelijking met mensen.” Naar eigen zeggen is hun model uiterst uniek. 

Michielsen: “Inclusief een dataset met zoveel annotaties voor wilde bloemen is ons model de grootste van de wereld durf ik wel te zeggen.” Ze spraken al met de waterschappen en er zit meer in het vat, denkt Schouten. “Er is grote behoefte om dit soort dingen automatisch te kunnen meten. Wij kunnen dat”, besluit hij.

Boilerplate

Wil je meer weten over het onderzoek? Lees dan de publicatie van Gerard Schouten, Bas Michielsen en Barbara Gravendeel. 

Reageren kan hieronder. Eenmaal gepubliceerde reacties worden niet verwijderd

Reacties 1 - 1 (1)
Bedankt voor uw bericht.
Nick
20
September
2024
Gefeliciteerd collega's Bas en Gerard! Mooi artikel.