Wetenschapper Marcel Salathé voert de data in, en de computer bedenkt vervolgens een manier om ziektes te herkennen. Handig! Alleen: wie heeft er toegang tot onze data? ‘Mijn grootste zorg is gecontroleerd te worden door een heel kleine groep mensen.’

Wat doe je als je een raar plekje op je arm ontdekt? Of als je hoofdpijn hebt, koorts en een hoestbui? Je googelt. Je tikt een paar zoekwoorden in een zoekmachine en als je vervolgens in paniek raakt, of als de klacht blijft, bel je de dokter. De arts stelt een diagnose en als deze interessant is, tikt hij of zij die weer in op een toetsenbord verbonden met een grote landelijke database.

Dagen voordat de medici weten dat je ziek bent, is Google daar dus al van op de hoogte. In 2008 lanceerde Google daarom Google Flu Trends. Op een landkaartje kon je het verloop van een griepepidemie volgen. Door het analyseren van zoekopdrachten als ‘hoesten’ en ‘koorts’ konden de technici van Google bekijken hoe het virus zich over de wereld verplaatste. In 2009 verscheen er zelfs een baanbrekend artikel in Nature. De auteurs van Google lieten zien hoe goed ze het verloop van een griepepidemie bijna real time konden volgen. Het nowcasten van Google Flu Trends trok de aandacht. ‘Big data’ waarmee je ‘het nieuws voor kon blijven’, dat klonk lekker bij de powerpointpresentaties bij grote bedrijven en overheidsdiensten.

Ook de Zwitserse wetenschapper Marcel Salathé sprong op van zijn stoel toen hij het artikel las. Van het ene op het andere moment wist deze – toen nog – dertiger eindelijk wat hij wilde zijn: ‘digitaal epidemioloog’. Nu werkt hij in zijn eigen ‘Salathé Lab’ op de biotech campus in Genève, Zwitserland. Ik spreek hem een paar keer per telefoon. In de filmpjes van zijn lezingen bij TEDx Lausanne en Open Data ziet hij er verzorgd uit. Kort geknipte haren. Blauw jasje, lichtblauw overhemd en lichtbruine broek. Niks verraadt dat hij een verleden heeft als conceptueel kunstenaar en rockpianist van de Zwitserse band Phébus die aan het begin van deze eeuw door Europa toerde, met als hoogtepunt een voorprogramma van Lenny Kravitz in Zürich.

‘Mijn grote liefde was muziek,’ zegt Salathé, ‘ik wist echt niet wat ik wilde studeren. Ik streepte een voor een alle vakken weg die me niets leken. Biologie bleef als laatste over.’ Maar Salathé bleek een goede student. Na zijn promotie kon hij terecht als postdoc in Stanford. Hij moest kiezen tussen zijn rockcarrière en de wetenschap. Het werd de wetenschap. In Stanford las hij het Nature-artikel over Google Flu Trends en richtte zich daarna op het onderzoeken van ziekteuitbraken door twitterdata te bekijken. ‘Twitter is openbaar, het brengt netwerken in beeld en geeft vaak informatie over locatie.’ Salathé onderzocht met behulp van Twitter de bijwerkingen van hiv-medicijnen en hoe positieve of negatieve ideeën over vaccinatie zich als virussen verspreiden door netwerken. ‘Nu ben ik betrokken bij een artikel dat kijkt naar een uitbraak van chikungunya, een virusziekte die net als zika in opkomst is en ook door muggen wordt verspreid. Er was een uitbraak op Martinique. Ons team liet zien dat het zonder de twitterdata moeilijk was om te begrijpen hoe de ziekte zich uitbreidde. Door tweets te analyseren, konden we zien hoe bekend de twitteraars waren met de ziekte en hoe ze zich ertegen beschermden. Dit gedrag bleek een duidelijk effect te hebben op hoe de ziekte zich verspreidde.’

We laten computers zelf leren op basis van de data en vinden ze dingen waarvan we nooit gedacht hadden dat ze er waren.

Overschatte griepepidemie

Marcel Salathé is inmiddels een van de weinige experts op het gebied van de ‘digitale epidemiologie’. Maar het vakgebied lijkt op het eerste gezicht zijn beste tijd gehad te hebben. Na de opwinding kwam de kritiek. Google Flu Trends overschatte de griepepidemie van 2013. En niet zo’n beetje ook. De wetenschappers van Google mompelden beschaamd dat het waarschijnlijk iets te maken had met de media-aandacht voor deze Mexicaanse griep, waardoor ook mensen begonnen te googelen die helemaal niet ziek waren. De algemene verwachting was dat Google de dienst zou verbeteren. Maar in augustus 2015 verdween Google Flu Trends geruisloos. Het tijdschrift Wired sprak van een ‘epic failure’.

Was het achteraf een beetje een hype, Google Flu Trends?
‘Als het op hypes aankomt, ben ik van de opvatting dat waar rook is, ook vuur is. Mensen hadden misschien te hoge verwachtingen van Google Flu Trends, maar het was duidelijk het begin van een nieuw onderzoeksveld en een nieuwe databron, die in de toekomst alleen nog maar belangrijker zal worden. Misschien is het nu uit de mode, maar dat zegt meer over de media dan over het belang van dit soort methoden.’

Waarom heeft Google de Google Flu Trends dan uit de lucht gehaald?
‘Dat is niet bekend. Het officiële statement van Google Flu Trends had niet veel korter kunnen zijn. Ik weet niet wat er is gebeurd. In 2014 verscheen een artikel in Science waarin wetenschappers Google Flu Trends bekritiseerden omdat ze systematische fouten maakten. Misschien dat het daar iets mee te maken had. Persoonlijk denk ik dat Google Flu Trends niet slecht was. Niet zo slecht als mensen denken. Het was zelfs vrij nauwkeurig. Ik vind het jammer dat het uit de lucht is. Voor veel landen was Google Flu Trends veel beter dan het alternatief. Niet iedereen woont in Amerika, Zwitserland of Nederland met voldoende geld en hulpmiddelen om een goed ziektevolgsysteem het hele jaar voor een heel land te onderhouden. Voor sommigen was Google Flu Trends een heel goede tool.’

Als je nu zoekt op ‘twitter’ en ‘python’, een populair programma om twitterdata te analyseren, krijg je meestal resultaten die al een paar jaar oud zijn. Het vakgebied lijkt zich niet erg te ontwikkelen.
‘Google bestaat al lang. Twitter is er ook al tien jaar en Facebook alweer twaalf jaar. Deze hulpmiddelen zijn – ik wil niet zeggen oud, maar het is niet meer de “voor sociale media”/“na sociale media”-situatie van tien jaar geleden. We zijn nu in een volgende fase, waarin je kunt praten over “voor deep learning” en “na deep learning”. Een paar jaar geleden probeerden we computers te instrueren om dingen voor ons te ontdekken. Nu laten we ze zelf leren op basis van de data en vinden ze dingen waarvan we nooit gedacht hadden dat ze er waren. Of je het nu hebt over beeldherkenning, het detecteren van ziektesignalen in teksten of sentimentanalyse van tweets. De ontwikkelingen zijn enorm.’

Wel spam, geen spam

Een deep learning-algoritme simuleert als het ware een machientje dat zijn eigen bedradingen steeds verandert, net zoals een brein dat doet. Je ‘voedt’ het apparaatje met een foto, een geluid of een e-mail – een reeks eentjes en nullen – en er rolt een getal uit. ‘Wel spam’ als het getal groter is dan ‘100’ of ‘geen spam’ als het kleiner is. Als het apparaatje het goed heeft, beloon je hem en hoeft hij niet te veranderen, als hij het verkeerd heeft, moet hij zijn bedradingen aanpassen net zolang tot het goede antwoord eruit komt. Naarmate het machientje meer input krijgt, wordt het beter en beter.

Het idee van deep learning of machine learning komt uit de jaren vijftig. De computerwetenschapper Arthur Samuel liet twee computers tegen elkaar schaken. Als een computer won was dat ‘goed’ en wijzigde de winnende computer weinig aan zijn tactiek. Als een computer verloor, was dat ‘slecht’ en probeerde de computer iets radicaal anders. Het resultaat was dat de computers beter leerden schaken dan Arthur Samuel zelf. Hij liet daarmee zien dat computers elkaar kunnen trainen en weerlegde daarmee tegelijkertijd het argument dat computers nooit slimmer kunnen worden dan mensen, omdat mensen computers programmeren. Omdat computers andere computers trainen, kunnen ze niet alleen even slim worden als mensen, maar ook honderd keer slimmer, of een miljoen keer slimmer. ‘Het herkennen van patronen is iets wat we associëren met intelligentie. Computers waren daar traditioneel slecht in, maar dat verandert nu razendsnel,’ zegt Salathé, ‘het is niet de vraag of computers veel intelligenter dan mensen worden, maar hoe snel dat gebeurt. En wat dat betekent. Wat betekent het om een miljoen keer slimmer te zijn dan een mens? Dat is bijna per definitie niet te begrijpen. Hoe leg je een mier uit wat het is om een mens te zijn?’

Het is niet de vraag of computers veel intelligenter dan mensen worden, maar hoe snel dat gebeurt en wat dat betekent. Dat is bijna niet te begrijpen.

Alexa

Deep learning heeft de laatste paar jaar een stormachtige ontwikkeling doorgemaakt. Het herkennen van een man voor een huis met een boom naast een rivier was vijf jaar geleden nog onmogelijk voor een computer. Het herkennen van je vrienden op een Facebookfoto was tot voor kort mensenwerk. In 2010 bakten computers er helemaal niks van. Nu doen ze het met twee USB-sticks in de neus. Om een indruk te krijgen van hoe snel het gaat, hoef je alleen maar een YouTube-filmpje over de ‘Echo’ van Amazon te bekijken. Een apparaat dat reageert op de naam ‘Alexa’ en die desgevraagd dingen voor je opzoekt op internet, muziek kan spelen, je agenda in de gaten houdt, de weersvoorspellingen kent en bestellingen voor je kan plaatsen. Het is zoiets als Siri, maar dan beter. Een Star Trek-achtig apparaat met Big Brother-achtige kantjes. Alles wat je tegen Alexa zegt, wordt opgeslagen om de deep learning-algoritmes te trainen en de spraakherkenning nog beter maken. Als veel mensen de Echo gaan gebruiken, en op de opvolgers daarvan – die misschien ook de rol van arts, persoonlijke assistent en psychiater zal gaan spelen – krijgt Amazon een schat aan persoonlijke data.

Foto: Nicolas Righetti
Luchtfietserij

Salathé maakte de deep learning-revolutie van dichtbij mee. In 2013 lanceerde hij samen met de bevriende bioloog Dave Hughes het platform PlantVillage. Boeren kunnen foto’s van zieke planten uploaden. Blaadjes met pukkeltjes, verkleuringen en gaatjes. De deelnemers helpen elkaar met het oplossen van de problemen. Of ze nu boer of wetenschapper zijn. Het idee achter PlantVillage is dat alle kennis die helpt om voedsel te kweken openbaar toegankelijk moet zijn. De kennis kan verzameld worden mede met behulp van mobiele telefoons, overal ter wereld. Ongeveer 35 procent van de nu vier miljoen gebruikers van PlantVillage komt uit ontwikkelingslanden.

Hughes en Salathé probeerden of ze een algoritme konden bouwen dat de plantenziektes kon herkennen zonder tussenkomst van een mens. In het begin was het luchtfietserij, twee van de drie keer ging het fout. Maar nu werkt het goed. Een deep learning-algoritme dat de biologen trainden met plaatjes van 14 plantensoorten en 26 ziektes, haalde een score van 99,35 procent. ‘Over een half jaar komt de deep learning-app beschikbaar. Als mensen die gaan gebruiken, zal het algoritme verder leren en beter en beter worden.’

Als mensen straks terugkijken op dit tijdperk, met richtlijnen van wat goed en wat slecht is om te eten, zullen ze die compleet belachelijk vinden.

Slimme toiletten

Er is weinig fantasie nodig om te bedenken hoe deep learning de dermatologie-apps – die er nu al zijn en een foto van je huid diagnosticeren – zullen verbeteren. Met een beetje meer fantasie zijn de mogelijkheden niet te overzien. Bijna alles wat je doet, heeft ook iets met je gezondheid te maken. Alle data die je genereert met je smartphone en je Facebook-updates, je google-zoekopdrachten, je GPS-locatie, de stappenteller, je netwerk vormen een schatkamer aan persoonlijke gegevens. Zeker als je ze combineert met de data van ziekenhuizen, artsen, Albert Heijn en credit-cardbedrijven.

De databronnen worden in hoog tempo rijker en interessanter. Google werkt aan contactlenzen die je glucosespiegel kunnen meten. ‘En ik ben er zeker van dat er slimme toiletten komen die je darmflora meten, iedere keer als je iets kwijt moet,’ zegt Salathé, ‘zeker nu bekend is dat voor je bloedsuikerspiegel zo veel afhangt van je darmflora.’

Eind 2015 verscheen een artikel in het wetenschappelijke tijdschrift Cell, waarin Israëlische wetenschappers lieten zien dat goede voeding voornamelijk afhangt van de bacteriën die in je darmen leven, je micro-bioom. Hoe gezond of ongezond een patatje is, hangt af van je darmflora. En die is van mens tot mens en van maand tot maand verschillend.

‘Iedereen heeft zich daar nu op gestort. Niet alleen academici, maar ook bedrijven als Unilever en Nestlé. Als mensen straks terugkijken op dit tijdperk, met richtlijnen van wat goed en wat slecht is om te eten, zullen ze die compleet belachelijk vinden. Wat goed is voor mij, kan slecht zijn voor jou. En wat nu goed voor mij is, kan over een half jaar slecht voor me zijn.’

Het zal in de nabije toekomst werkelijk mogelijk zijn om op basis van nieuwe data en sensoren obesitas te bestrijden, suikerziekte aan te zien komen en mensen in ontwikkelingslanden te helpen om infectieziektes en malaria te bestrijden. Of om nieuwe opkomende infectieziektes in een vroeg stadium te herkennen.

Plantenziektes herkennen: boeren leveren de foto’s en de app doet de rest.
Digitale betuttelingshel

Mobiele telefoons die de rol van arts spelen in ver afgelegen gebieden. Het zal voor de een klinken als een utopie en voor de andere als een soort digitale betuttelingshel. Er zitten ook ronduit griezelige kanten aan. Deep learning-algoritmes kunnen patronen in je gedrag blootleggen waar je jezelf niet bewust van bent, en die misbruikt kunnen worden door de mensen met de data en de superslimme algoritmen.

Er is namelijk een groot probleem: onze data zijn niet van ons. Data van artsen en ziekenhuizen liggen achter slot en grendel opgeborgen vanwege privacy-redenen. Ook de data van Google, Facebook, Amazon en Albert Heijn zijn grotendeels versleuteld weggeborgen. Met de toekomstige data over onze darmflora en glucosespiegels zal dat net zo zijn. Alle kennis die ons kan helpen om gezonder te leven, is in handen van organisaties en bedrijven en veel is niet toegankelijk voor ons. Om privacy-redenen en om commerciële redenen.

Salathé ziet dat als een groot gevaar. ‘Mijn grootste zorg is om gecontroleerd te worden door een heel kleine groep mensen, organisaties die de deep learning-technologie bezitten. Je krijgt een winner takes all-situatie, zoals al een beetje gebeurt in de technologiewereld. Er is één grote zoekmachine, één groot sociaal netwerk. Technologie heeft jammer genoeg deze dynamiek, en dat is iets wat we te allen tijde moeten voorkomen met deep learning. Niemand zal in staat zijn om te concurreren met de mensen die deze technologie beheersen.’

Maar iedereen die een beetje moeite doet, kan toch een deep learning-programmeur worden? Die programma’s zijn toch niet van Google, Facebook en Amazon?
‘Inderdaad. Aan de software-kant zit het wel goed. Google is zelfs proactief daarin. Ze creëerden een beweging die veel bedrijven ertoe aanzette om de computercodes open source te maken. Ze waren een van de eersten daarin. We kunnen er redelijk op vertrouwen dat die codes niet in de handen van een paar bedrijven zullen zijn. Het probleem is alleen dat deep learning niet in de software zit, de software leert van data. Deep learning-algoritmes worden pas waardevol als er data zijn om ze te trainen. De data die bedrijven over ons verzamelen door ons diensten te leveren die we heel graag gebruiken. Die data zijn niet “open”. We moeten manieren vinden om toegang te krijgen tot deze data zonder de economische mogelijkheden van deze bedrijven te vernietigen, want dat is ook weer niet de bedoeling. Het is ook goed dat deze bedrijven er zijn, die de technologische grenzen echt vooruitduwen.’

Heldere wetten

Het hebben van data is nu meer dan ooit het hebben van macht. En de macht is in handen van te weinig mensen. Dat is volgens Salathé een groot gevaar voor de democratie. ‘Regeren gaat over het organiseren van macht. En de macht moet verdeeld worden over velen en niet in handen komen van een kleine elite.’ Salathé haalt de negentiende-eeuwse Britse politicus Lord Acton aan: ‘Vrijheid bestaat uit het verdelen van macht, absolutisme uit het concentreren van macht.’ Als vrijheid bestaat uit het verdelen van macht, en het hebben van data gelijk staat aan het hebben van macht, dan moeten we dus een manier vinden om de data over de mensen te verdelen.

Maar hoe kun je privacy-gevoelige data over mensen verdelen?
‘Ik denk dat de eerste stap moet zijn dat we heldere wetten krijgen die voorschrijven dat iedereen fundamentele rechten heeft om zijn eigen data te bezitten. Dus als iemand data verzamelt over mijn gedrag, dan moet ik toegang tot deze data kunnen krijgen. Het is eigenlijk lachwekkend dat dat niet zo is. Als ik wil weten hoeveel ik het laatste jaar heb uitgegeven, kan ik naar de bank gaan en mijn gegevens inzien. Maar met een consumentenkaart van een supermarkt is dat niet zo. Als ik wil weten welke voedingsmiddelen ik afgelopen maand heb gekocht, geeft de supermarkt me die data niet. Er moet een wet komen die voorschrijft dat als mensen data over jou verzamelen, je zelf toegang tot die data moet hebben. Zelfs zonder dat je ernaar moet vragen. Als dat geregeld is, kunnen we systemen ontwikkelen waarbij mensen toegang tot hun data kunnen geven aan derde partijen, bijvoorbeeld aan wetenschappers of bedrijven die medicijnen ontwikkelen. Er moet een website zijn waar je jouw data kunt downloaden en een account waar alle door jou gegenereerde data instaan: ieder medicijn waarvoor jouw gezondheidsverzekeraar betaalt, iedere diagnose die je krijgt van je arts wordt daar automatisch opgeslagen. Die website moet voor jou toegankelijk zijn en jij mag beslissen wat er met deze data gebeurt. Of je het aan onderzoeksprojecten geeft, of aan bedrijven die nieuwe medicijnen ontwikkelen.’

Voorbeelden van dit soort constructies bestaan al. Als je een reageerbuis met wangslijm opstuurt naar het Amerikaanse bedrijf 23andme, krijg je voor 169 dollar een file met je complete genoom. Je kunt die file doneren aan OpenSNP. Meer dan 2500 mensen hebben dit al gedaan. Niet zo veel misschien, maar het is nu al wel de grootste open toegankelijke menselijke DNA-database.

Maar is het niet heel eng dat 23andme dan alles van je weet, en om je genoom ook nog eens op te sturen naar een open toegankelijke database?
‘Of mensen dat gaan doen, hangt natuurlijk af van de vraag of ze zich veilig voelen om dat te doen. Als er veilige, vertrouwde diensten zijn waar je je data naar kunt uploaden, kunnen daar heel interessante dingen uitkomen.’

Denkt u dat dit haalbaar is?
‘Er zijn een paar platforms die het proberen, zoals in Zwitserland Healthbank.coop en midata.coop. Dit zijn onafhankelijke datamakelaars die in bezit zijn van de mensen zelf, databanken waar je je eigen data kunt bewaren en zelf kunt bepalen welke data je deelt met anderen. Het is allemaal nog in de beginfase, maar het is aan het gebeuren, en de komende vijf jaar zal veel gebeuren op dit gebied. Iedereen vindt het fijn om gebruik te maken van Uber, maar iedereen haat het feit dat het een bedrijf is dat heel veel winst maakt en privacygevoelige data verzamelt. Wat we nodig hebben, is een bedrijf als Uber maar dan coöperatief; dat in bezit is van de mensen die achter het stuur zitten. Alles beweegt in de richting van dit soort platforms, dat is niet te stoppen. We moeten er nu voor zorgen dat deze platforms coöperaties worden, niet gewoon ondernemingen die een monopolypositie verwerven.’

Wie

Marcel Salathé (Zwitserland, 1975)

Bekend van

Marcel Salathé is een digitaal epidemioloog die werkt in Genève. Hij is actief op het overgangsgebied van de biologie naar de computerwetenschappen. Hij schreef het boek Nature, In Code en deed baanbrekend onderzoek om Twitter te gebruiken om de verspreiding van infectieziektes te analyseren. 

Waarom

Samen met bioloog David Hughes maakte hij PlantVillage, een platform waarop boeren hun kennis over plantenziekten kunnen delen. Dit jaar verscheen een artikel op Arxiv.org waarin Salathé en Hughes laten zien dat ze met behulp van deep learning-algoritmen van hun platform een digitale plantendokter kunnen maken. Deze app komt begin volgend jaar beschikbaar.

Enz

Marcel Salathé speelde in verschillende rockbands waaronder Phébus, die ooit door Europa toerde, en stond in het voorprogramma van Lenny Kravitz. Bij een online kunstproject met schilderijen van getallen wist hij er 800 te verkopen. Hij maakte ook de app Moocdemic, een ‘massive multiplayer epidemic game simulation’.