Tijd voor actie
Opschonen van je data
Nu duidelijk is welke termen je hebt, hoeveel termen je hebt en dat er acties eraan moeten worden verricht, kunnen we door met de volgende stap. Bedenk hoe je het aanpakt: wat wil je als eerste in orde maken, en wat kan later? Vaak kiezen organisaties ervoor om met de meest eenvoudige verbeteringen te beginnen. Die zorgen al gelijk voor echt schonere data. Daarna kunnen de stappen volgen die wat meer denkwerk vragen, zoals aan welke term geef ik de voorkeur als in een veld meerdere spellingsvarianten en synoniemen zijn gebruikt? Hieronder komen de verschillende soorten acties aan bod.
-
Onbedoelde spaties
Om te beginnen met opschonen is het verwijderen van onbedoelde, niet-zichtbare spaties de makkelijkste eerste stap. Onbedoelde spaties voor of achter een term maken dat deze term door de computer anders wordt gelezen als dezelfde term zonder die spatie ervoor of erachter. Voor de registrator zelf is een spatie die per ongeluk is toegevoegd heel moeilijk zichtbaar; achter een term zelfs helemaal niet. Eigenlijk kom je er alleen achter als je twee keer dezelfde term in je thesaurus ziet. Met OpenRefine kan je dit eenvoudig oplossen. Onder de knop Edit cells vind je Common transforms. Onthoud deze knop, die gaan we later nog eens gebruiken. We kiezen nu onder Common transforms de knop Trim leading and trailing whitespace.
Nadat je Trim leading and trailing whitespace hebt aangeklikt, worden termen die wel hetzelfde geschreven zijn, maar nul, een of meerdere spatie(s) voor of achter de term hebben staan, samengevoegd tot één term. In Text facet zie je de aanpassingen meteen plaatsvinden. Alle spaties zijn nu verdwenen.
-
Circa/vermoedelijk/ongeveer
In het registratieproces kom je vaak onduidelijkheden tegen. Je weet niet precies wie de maker is, wanneer het object gemaakt is, uit welke materialen een object bestaat. Al snel wordt er aan een term dan een woord als vermoedelijk toegevoegd. Of bij een datumnotatie wordt ongeveer neergezet of wordt er een vraagteken toegevoegd. Dit maakt het lastiger om de betreffende term of datum te vinden.
Een datumveld is, zoals de naam al zegt, volledig ingericht op een datumnotatie. Wanneer je hier een woord als ongeveer of circa aan toevoegt haal je dit systeem door de war. Mocht je je data digitaal willen presenteren, en op het presentatieplatform wordt gebruik gemaakt van selectie op basis van datum, dan wordt het veld niet herkend als datum en dus niet meegenomen in die indeling. En ook het woord vermoedelijk als toevoeging aan bijvoorbeeld een object-, materiaal, of vervaardigersterm bemoeilijkt het terugvinden van dit record. Alle tekst die in een veld staat zal het collectie-informatiesysteem namelijk als een geheel zien. Het systeem heeft geen inhoudelijke kennis, en zal dus de materiaalsoort of objectnaam er niet uit filteren. Plaats deze woorden die een vermoeden of inschatting aangeven dan ook altijd in het opmerkingenveld dat bij de term staat.Om deze twijfelwoorden uit de kolom te halen, ga je kolom voor kolom aan de slag. Onder de knop Edit cells zit de knop Replace. Deze knop voert een zoek- en vervang-actie uit. In het scherm dat geopend is, typ je bij Find het woord dat weggehaald moet worden. Wanneer je bij Replace with niks noteert zal hij de term wel zoeken maar niks toevoegen.
Hiermee zijn deze twijfelwoorden verwijderd uit deze kolom. -
Meerdere termen in één veld
Een object kan van verschillende materialen gemaakt zijn. Denk aan hout, metaal en plastic. Wanneer die termen als opsomming in één veld in het collectie-informatiesysteem zijn genoteerd, zorgt dat ervoor dat het systeem dit als een geheel gaat zien, dus als één term. De termen worden dus niet onderscheiden van elkaar.

Zoek je in het collectie-informatiesysteem naar alle objecten die van hout gemaakt zijn, dan komt een object met verschillende termen in één veld niet naar boven. Vanuit de registratiestandaarden is het daarom gebruikelijk om iedere losse term een eigen veld te geven. Wil je meer weten over hoeveel termen je per veld gebruikt? Lees dan het Dataprofiel Collectieinformatie voor het publiek. Hier lees je meer over hoe je de informatie over je collectie vastlegt, maar daarbij ook toegankelijk blijft voor het digitale publiek.

Heb je in een veld verschillende termen, vaak van elkaar gescheiden door een komma (,), puntkomma (;) of slash (/), dan zet je deze elk in een apart veld. Gebruik hiervoor onder het kopje Edit column de knop Split into several columns.
Wanneer je op deze optie klikt, opent zich een scherm. Onder How to split column kun je aangeven dat je wilt splitsen op basis van een separator. In dat veld vul je in welke separator er gebruikt is (dus de komma, puntkomma, slash, etc.). Wanneer je dan op OK drukt, wordt de kolom gesplitst in losse kolommen.Mochten er in een veld zowel een komma, puntkomma en een slash zijn gebruikt, dan voer je deze actie uit per soort scheidingsteken. Je krijgt nu meerdere kolommen met in elke kolom een term.
Per keer dat je de kolom splitst, wordt er een nummering aan de kolomnaam toegevoegd. Was een veld opgebouwd uit vijf materiaaltermen, dan zal je vijf kolommen met de naam Materiaal krijgen met daarachter de nummering een tot en met vijf.
Mochten er meerdere soorten scheidingstekens gebruikt zijn, dan heb je meerdere splitsacties nodig. Als je een extra splitsactie uitvoert in de kolom Materiaal 1, dan wordt die kolom verwijderd en vervangen door de kolommen Materiaal 1 1 en Materiaal 1 2. Doordat er (in dit geval) twee splitsacties hebben plaatsgevonden, ontstaan er lege velden. Dit los je makkelijk op.

Via Edit column staat er onder Split into several columns de knop Join columns. Je klikt de kolommen aan die je wil samenvoegen, in dit geval Materiaal 1 2 en Materiaal 2. Vervolgens klik je Delete joined columns aan. Hiermee zorg je dat de dubbele kolommen worden samengevoegd en er 1 variant van overblijft. De eerdere, dubbele kolommen worden automatisch verwijderd. Nadat je op OK hebt gedrukt, heb je het aantal kolommen zo ver mogelijk teruggebracht, maar wel ruimte gehouden voor alle individuele termen.
-
Hoofdletter of kleine letter?
Een veelvoorkomende situatie is dat er door de jaren heen hoofdletters en kleine letters door elkaar gebruikt zijn. Objectnamen schrijven we volgens de norm van minimale registratie bijvoorbeeld met kleine letters. Maar soms vergeet je dat in het registratieproces.
De eerder genoemde Common transforms (onder Edit cells) komt nu weer van pas. Open deze knop, daaronder vind je de knop To lowercase. Met die knop zorg je ervoor dat alle termen in die kolom beginnen met een kleine letter. Wil je zorgen dat alle termen juist beginnen met een hoofdletter, bijvoorbeeld bij plaatsnamen of straatnamen, dan gebruik je de knop To titlecase. -
Datumnotaties omzetten
Datums worden vaak op verschillende manieren geschreven: dag-maand-jaar, jaar-maand-dag, uitgeschreven of met cijfers. Gelukkig herkent OpenRefine deze zo goed als allemaal. Eerder heb je al woorden als circa uit de datumvelden gevist. Nu gaan we die verschillende datums omzetten naar de ISO 8601-norm, welke jaar-maand-dag is.
Onder de eerder genoemde knop Common transforms, die onder Edit cells is te vinden, zit de knop To date. Daarmee wordt de data uit deze kolom omgevormd tot een datumnotatie.Mocht er een periode zijn vastgelegd als twee jaartallen met een streepje ertussen, zorg dan dat je ook de velden begindatum en einddatum invult. Dit zullen dus twee losse kolommen worden. Het scheiden van deze jaartallen gaat op dezelfde manier als het scheiden van meerdere termen in een veld. Mocht de periodisering zijn vastgelegd als tekst, zorg dan dat je deze voorziet van een begindatum en een einddatum. Jaren ‘80 zou dan beginnen met 1980 en eindigen met 1989.
-
Overbodige termen
Een van de uitkomsten van de analyse kan zijn dat een aantal termen overbodig is, omdat ze hetzelfde betekenen. Niet consequent dezelfde term gebruiken, maar verschillende spellingsvarianten of synoniemen hanteren, maakt je objecten moeilijker vindbaar. Wanneer je alle fietsen in je collectieregistratie wil zoeken, krijg je de enkele gevallen die als rijwiel zijn geregistreerd niet boven. Daarom kan je er bijvoorbeeld voor kiezen om de minder gebruikte termen te vervangen door een synoniem dat al vaker in de registratie gebruikt wordt. De termen kan je op meerdere manieren aanpassen.
De eerste optie is om met je muis over die ene cel te zweven. Er verschijnt dan rechts in de cel de knop Edit this cell. Als je dat aanklikt, opent zich een schermpje waarin je de tekst kan bewerken. Met de knop Apply kan je de bewerking doorvoeren voor deze ene cel, maar je kan ook alle cellen met precies deze tekst wijzigen. Klik dan na het aanpassen van de tekst op Apply to all identical cells. Zo voer je een bewerking door voor bijvoorbeeld alle velden waarin ets genoteerd staat. Dit kan dan in bulk allemaal worden omgevormd tot bijvoorbeeld ets.Deze zelfde aanpassingen kun je ook maken in de Text-facet kolom. Wanneer je in die kolom over de term zweeft die je wilt wijzigen, komt ook weer de edit-knop tevoorschijn. Wanneer je daarop klikt, opent zich weer een bewerkscherm. Wat deze keer wel anders is, is dat als je deze term bewerkt, deze voor alle gelijke termen direct wordt aangepast.
Wanneer je in bovenstaand geval Ets wijzigt in ets, worden alle 7 “Ets”-en aangepast tot ets. Omdat dat dezelfde schrijfwijze is als de al aanwezige ets, worden deze samengevoegd. Na deze wijziging komt de term ets dus geen 4 keer meer voor, maar 11 keer. En wanneer je dit ook doet met ets in kleur komt de term ets dus 12 keer voor.
-
Cluster and edit
Een extra handige functie om termen met dezelfde betekenis op te sporen vind je onder de knop Edit cells de functie Cluster and edit. Deze functie herkent termen die op elkaar lijken en die dus mogelijk dezelfde betekenis hebben. Aan de hand van verschillende matchingstechnieken worden overeenkomsten gezocht. Vergeet niet de knop Auto-update aan te vinken zodat je de resultaten direct ziet. Om te zorgen dat je alle suggesties ziet, is het verstandig om alle keying functions en vervolgens de distance functions na te lopen. Zo weet je zeker dat je alles wat OpenRefine op elkaar vindt lijken hebt beoordeeld. Wat deze technieken precies inhouden valt terug te lezen in de handleiding van OpenRefine zelf.
Zie je termen die inderdaad samengevoegd moeten worden, dan vink je dat cluster aan in de kolom Merge?. Mocht het grootste deel van het cluster samengevoegd moeten worden, maar niet alle termen? Vink dan in Values in cluster de termen aan die wel samengevoegd moeten worden. In de kolom New cell value staat een voorbeeldwaarde. Deze waarde wordt de nieuwe waarde van de samengevoegde termen. Je kan ervoor kiezen om een van de waarden te kiezen uit het cluster. Achter de clusterwaarden zie je ook hoe vaak deze in de kolom voorkomen. Dit kan je helpen met het maken van de keuze welke waarde je kiest.
Wil je dat de termen in het cluster worden aangepast naar een van de termen uit het cluster, klik die dan aan. De term wordt dan direct overgenomen in New cell value. Je kan ook zelf in het veld typen welke waarde het moet worden. Als je dit hebt gedaan, door wil voeren en dan verder wil kijken naar mogelijke andere clusters, klik dan op Merge selected & re-cluster. De in merge-aangevinkte clusters worden verwerkt zoals je het klaar hebt gezet, maar het bewerkscherm blijft open staan. Heb je een cluster niet aangevinkt? Dan gebeurt er niks met dat cluster.
Heb je alle clusters in één keer nagelopen en ben je daarna klaar? Dan kan je de knop Merge selected & Close kiezen. Dan wordt het bewerkscherm afgesloten.