Näytetään tekstit, joissa on tunniste DDI. Näytä kaikki tekstit
Näytetään tekstit, joissa on tunniste DDI. Näytä kaikki tekstit

2. heinäkuuta 2025

A Week of Learning and Collaboration - Júlia’s visit to FSD

In May 2025, FSD welcomed Júlia Egyed-Gergely from Hungary for a week-long visit to become acquainted with how DDI-based data curation is carried out in social science data archives.

Júlia is a staff member at the HUN-REN Centre for Social Sciences, Research Documentation Centre (HUN-REN CSS RDC). The RDC and two other institutes manage and operate the HUN-REN Data Repository Platform (HUN-REN ARP). Júlia described the visit as highly useful and beneficial. She felt warmly welcomed by the FSD team, who shared their knowledge and practical examples. She especially appreciated the opportunity to join the team for a short time and gain insight into its daily work.

Júlia Egyed-Gergely.

“The FSD Team is so helpful. I think I was at the best place to learn about DDI and research data management. I really liked the fact that the team is made up of well-prepared, well-informed professionals, and that everyone has their own area of responsibility and does their job professionally,” Júlia summarised.

During the visit, FSD introduced both FSD and Tampere University (TAU), covering processes and examples of research data management, data archiving, metadata management, infrastructure building, and the Finnish Open Science landscape. Júlia noted that the topics discussed during the visit were all highly useful and will help her to improve infrastructure and workflow at RDC.

“I learned a lot about DDI, how to use it and what are the benefits of using it. I have a much better understanding of the potential of DDI, the theoretical, practical and technical background of it, and the benefits this initiative and system could provide to my home institution,” Júlia said, describing the benefits of her visit.

Júlia (3rd from the left) also presented the activities and services of the RDC to the FSD staff.

In addition, the visit included topics related to the TRUST principles, CESSDA, the process of becoming a trustworthy repository, and FSD’s involvement in both national and international data service collaborations and projects. We also engaged in discussions about similarities and differences between FSD and the RDC, which offered valuable perspectives and strengthened mutual understanding.

“Cooperation is very important for repositories. Learning from each other, sharing best practices are highly useful and forward-looking,” Júlia concluded.

And we agree with Júlia. We warmly thank Júlia for her visit and the valuable discussions we were able to have.

Lisätietoa:
» HUN-REN Centre for Social Sciences, Research Documentation Centre (HUN-REN CSS RDC)
» HUN-REN Data Repository Platform (HUN-REN ARP)

Henna Kaartinen
Project Assistant
firstname.lastname [at] tuni.fi

29. toukokuuta 2020

Tietoarkiston kehittämä Kuha2 edistää eurooppalaisten aineistojen löydettävyyttä

Kuha2 on yhteiskuntatieteellisten aineistokuvailujen jakamiseen tarkoitettu sovelluskokonaisuus. Sen käyttäjiä ovat muisti- ja tutkimusorganisaatiot, jotka haluavat saattaa koneluettavat aineistokuvailunsa toisten osapuolten hyödynnettäväksi käyttäen datan automaattista keräämistä eli harvestointia. Tämä edistää aineistojen näkyvyyttä ja löydettävyyttä, vahvistaa organisaatioiden välistä yhteistyötä ja parantaa kuvailukäytäntöjä.

Kuha2 koostuu useasta palvelinsovelluksesta ja asiakasohjelmasta. Se tukee OAI-PMH- ja OSMH1 -rajapintamäärityksiä. Kuha2-kehitystyö käynnistyi alkuvuodesta 2017 osana CESSDA SaW -hanketta. Hankkeen päämäärä oli tukea uusia ja kehittyviä CESSDA-arkistoja teknisten ratkaisujen löytämisessä, hyödyntämisessä ja kehittämisessä. Loppuvuodesta 2017 Kuha2 julkaistiin avoimena lähdekoodina. Tämän ensimmäisen tuotantokäyttöön soveltuvan version käyttö ja laajentaminen oli kattavasti dokumentoitu. Sovellus oli käytettävissä ilman laajaa teknistä osaamista, ja seurasi siten SaW-projektin tavoitetta. Ohjelman aktiivinen kehitystyö jatkuu edelleen. Ylläpidon lisäksi sovellus saa uusia toiminnallisia ominaisuuksia. Näistä viimeisimpänä julkaistiin tuki EAD3-formaatille tammikuussa 2020.

Aktiivinen kehitys luo puitteet käytön laajentumiselle

Tietoarkisto kehitti alkuperäisen Kuhan vuonna 2014 aineistojensa kuvailutietojen viemiseksi Finna-hakupalveluun OAI-PMH rajapinnan kautta. Vuonna 2016 Tietoarkistossa kehitettiin OSMH-rajapintamääritystä hyödyntävä Omicrops-palvelinsovellus. Kuha2 syntyi ajatuksesta luoda yksi yhtenäinen taustapalvelu tarjoilemaan sisältöä molempien rajapintojen tarpeisiin. Kokonaisuus purettiin pienempiin osiin mikropalveluarkkitehtuuria soveltamalla. Jokaisesta tehtävästä syntyi itsenäinen prosessi, joka keskustelee toisten prosessien kanssa standardoituja rajapintoja käyttäen.

CESSDA lanseerasi vuonna 2018 CESSDA Data Catalogue (CDC) -hakupalvelun, jonka on tarkoitus sisältää mahdollisimman monen CESSDAn palveluntuottajan aineistokuvailut. Se haravoi palveluntuottajien OAI-PMH-rajapintoja. Liittyäkseen CDC:hen palveluntuottaja tarvitsee hakupalvelun kanssa yhteensopivan kuvailuformaatin ja avoimen OAI-PMH-rajapinnan, jonka kautta kuvailut tarjotaan harvestoitavaksi. Kuha2 tukee sekä OAI-PMH-rajapintamääritystä että CDC:n käyttämää DDI2-formaattia. Tiivis yhteistyö Tietoarkiston ja CESSDAn välillä varmisti Kuha2:n yhteensopivuuden CESSDA Data Cataloguen kanssa.

CESSDA harvestoi palvelutuottajien tarjoman metadatan Kuha2-rajapintojen kautta avoimeen yhteisluetteloonsa.

DDI-standardia käytetään yhteiskuntatieteellisissä tietoarkistoissa datan kuvailuun. Standardista on yleisessä käytössä kolme eri versiota. Jotta Kuha2-sovellus toisi hyötyä myös muita versioita käyttäville organisaatioille, kehitimme tuontitoiminnallisuuteen tuen myös DDI1 ja DDI3 versioille. Tämän tuen ja CESSDA Data Cataloguen myötä Kuha2 on käytössä myös Tietoarkiston ulkopuolella. Tiedossamme on kolme muuta CESSDA-arkistoa, jotka hyödyntävät Kuha2-sovellusta omassa organisaatiossaan. Tietoarkisto on tarjonnut näille käyttöönottotukea sekä räätälöinyt asiakasohjelmaa siten, että käyttäjien metadatakuvailut tulkitaan sovelluksessa oikein. Kuha2:n käytön yleistymisen myötä CESSDA on saanut hakupalvelunsa piiriin uusia organisaatioita.

Käyttäjilleen Kuha2 tarjoaa helppokäyttöisen, avoimen, dokumentoidun ja tuotantovalmiin sovelluksen helpottamaan liittymistä CESSDAn hakupalveluun tai muihin vastaaviin harvestointia hyödyntäviin palveluihin. Käytön laajentumisen myötä virheraportteja ja toiveita uusille ominaisuuksille saadaan myös oman organisaation ulkopuolelta. Tietoarkistolla on valmiudet vastaanottaa ja katselmoida sovelluksen lähdekoodin muutoksia, sekä mahdollisesti liittää niitä osaksi sovellusta.

Avoimuuden periaatteet Tietoarkiston toiminnassa

Yhteistyö eri toimijoiden kesken edistää aineistojen löydettävyyttä ja käyttöä. Avoimet rajapinnat saattavat aineistojen kuvailut kaikkien hyödynnettäviksi ja mahdollistavat niiden soveltamisen yhä uusiin käyttötarkoituksiin. Avoin lähdekoodi vapauttaa käyttäjät teknologia- ja toimittajariippuvuuksilta, parantaa tietoturvan tasoa, helpottaa laadunvarmistusta ja saattaa ideat ja toteutukset kaikkien hyödynnettäviksi. Näitä työkaluja käyttäen Tietoarkisto toimii kansainvälisellä kentällä edistäen osaltaan teknologisten ratkaisujen kehittämistä ja tieteen avoimuutta.

Lisätietoa:

» Kuha2-dokumentaatio

Toni Sissala
sovelluskehittäjä
etunimi.sukunimi [at] tuni.fi

1OSMH (Open Source Metadata Harvester) on CESSDAn kehittämä metadatan harvestointiprotokolla.

Tämä blogikirjoitus on luettavissa myös englanniksi:
FSD's Kuha2 software improves discoverability of European research data.

FSD’s Kuha2 software improves discoverability of European research data

Kuha2 is a collection of applications intended for sharing descriptive social science metadata. It is targeted at cultural memory and research organisations that aim to make their data descriptions accessible for other parties in a machine-readable format by using automatic collection of data, in other words harvesting. This improves the visibility and findability of research data, strengthens cooperation between organisations and enhances the practices of data description.

The Kuha2 software consists of multiple server applications and a client application, and it supports OAI-PMH and OSMH application programming interfaces (APIs). The development of the Kuha2 software began in early 2017 as part of the CESSDA SaW project. The aim of the project was to support new and aspiring CESSDA archives in finding, utilising and developing technical solutions. At the end of 2017, Kuha2 was published as open-source software. The use and expansion of this first version that was suitable for production use was extensively documented. Kuha2 adhered to the aims of the SaW project in that no extensive technical knowledge was required to be able to use the software. Active development of the software is still in progress. In addition to software maintenance, new functional features are continuously added. For example, support for EAD3 format was released in January 2020.

Active development establishes the conditions for extensive use

FSD developed the original Kuha in 2014 for the purpose of transferring descriptive metadata to Finna, a search service that provides information from Finnish archives, libraries and museums, by using OAI-PMH protocol. In 2016, FSD developed the Omicrops server application that utilises OSMH protocol. Kuha2 was born from the idea to create one unified background service that would provide content for the needs of both APIs. The unified entity was dismantled into smaller parts by adapting microservice architecture. Each task became an independent process which communicates with other processes by using standardised APIs.

In 2018, CESSDA launched the CESSDA Data Catalogue (CDC) search service that aims to include descriptive metadata from as many CESSDA service providers as possible. It scrapes data from service providers using the OAI-PMH API. In order to integrate to CDC, the service provider needs a data description format compatible with the search service as well as an open OAI-PMH API that serves descriptive metadata for harvesting. Kuha2 supports both the OAI-PMH protocol and the DDI2 format used by CDC. Close cooperation between FSD and CESSDA ensured the compatibility of Kuha2 with the CESSDA Data Catalogue.

CESSDA harvests metadata provided by service providers to its open Data Catalogue via Kuha2-APIs.

The DDI standard is used in social science data archives for data description. In common practice, three different versions of the standard are in use. To benefit a larger group of organisations, Kuha2's import functionality was enhanced to support the DDI1 and DDI3 versions in addition to DDI2, which is used by FSD. Due to extensive support for DDI and the traction gained by CESSDA Data Catalogue, Kuha2 is in use outside FSD as well. To our knowledge, three other CESSDA archives utilise the Kuha2 software in their organisations. FSD has offered them support in getting started and customised the client application so that the users' descriptive metadata are interpreted correctly by the software. As the use of Kuha2 has become more common, CESSDA has gained new organisations as service providers for the CDC.

For its users, Kuha2 provides an easy-to-use, open, documented and production-ready software to facilitate joining the CESSDA search service or other corresponding services that utilise harvesting. With the expansion of use, error reports and requests for new features come in from outside our own organisation as well. FSD is prepared to receive and review source code changes, and possibly merge them as part of the software.

The principles of openness in FSD operation

Cooperation with different actors advances the discoverability and use of research data. Open APIs make descriptive metadata accessible to anyone and promotes reuse for new purposes. Open-source software allows its users to detach themselves from dependencies on technological solutions and product suppliers. It also improves the level of data security, makes quality assurance easier, and brings ideas and applications accessible for everyone. Using the aforementioned tools, FSD operates in an international field, advancing the development of technological solutions and open science.

More information:

» Kuha2 Documentation on Read the Docs

Toni Sissala
Software Developer
firstname.surename [at] tuni.fi

1OSMH (Open Source Metadata Harvester) is a harvesting protocol developed by CESSDA.

This blog entry is also available in Finnish:
Tietoarkiston kehittämä Kuha2 edistää eurooppalaisten aineistojen löydettävyyttä.

5. huhtikuuta 2019

FSD’s multilingual and qualitative data expertise brings in international visitors

During its 20 years of operation, FSD has established its status as a trusted partner in collaboration of data archives. On the initiative of our Japanese colleagues, we organised a seminar entitled Metadata, Data Catalogues and Tools for Findability in March.

The motivation for the seminar was a Japanese national project developing a joint data catalogue of several service providers. Our Japanese visitors chose to visit Finland and FSD because we have a long experience in successfully providing services in two languages, Finnish and English, as well as delivering metadata for harvesting by national and international joint catalogues.

We designed our presentations to answer the needs of our guests. FSD's experts shared experiences of using the DDI-C metadata format, the process of joining national and international multidisciplinary catalogues, the significance and utilisation of controlled vocabularies, and the CoreTrustSeal certification, among others.

Professor Yukio Maeda presents JSPS's plan for a federated data catalogue. Photo: Tuomas J. Alaterä

In addition to talks by FSD experts and our guests from Japan, the seminar featured presentations by the Director of CESSDA Ron Dekker and the Swedish National Data Service's IT Systems Architect Olof Olsson. It is important for CESSDA to collaborate with organisations outside of Europe. The seminar in Tampere provided a good opportunity to share information about CESSDA strategy and objectives in responsible data sharing as well as the CESSDA Data Catalogue, which contains both FSD's and SND's metadata. SND makes use of the DDI-L format, and Olsson's presentation on the topic offered a good comparison of two distinct metadata solutions. The presentation was also interesting from FSD's systems development point of view.

Similar challenges

The seminar showed that the challenges of research data management and sharing are very similar everywhere. Similarly to Finland and Europe, researchers in Japan have a positive attitude towards data sharing in principle. However, when it comes to sharing their own data with others, they do not feel comfortable doing so or they prefer to share the data themselves rather than letting professionals do it for them. Our data acquisition team regularly encounters similar attitudes.

Seminar attendees. Photo: Misa Senbonmatsu

What also sounded familiar was the fact that the development of the data infrastructure is not actually nationally coordinated in Japan. Instead, the funder has opened a competition where different service providers are able to apply for funding for projects with certain pre-defined conditions. The big picture is then made up of what various organisations think is necessary and which project proposals the funder approves. Another thing to consider is how established the infrastructure operations will be after the funding period.

More information:

» DDI-C ja L documentation
» CESSDA ERIC
» Swedish National Data Service SND
» Japan Society for the Promotion of Science JSPS
» FSD metadata records in machine readable formats
» Data are described in the DDI format
» Vocabularies used in FSD's data descriptions

Helena Laaksonen
director
firstname.surname [at] tuni.fi

This blog entry is also available in Finnish:
Monikielinen aineisto-osaaminen ja laadullisten aineistojen asiantuntemus tuovat kansainvälisiä vieraita Tietoarkistoon.

Monikielinen aineisto-osaaminen ja laadullisten aineistojen asiantuntemus tuovat kansainvälisiä vieraita Tietoarkistoon

Tietoarkisto on 20 toimintavuotensa aikana vakiinnuttanut asemansa luotettuna kumppanina data-arkistojen yhteistyössä. Maaliskuussa järjestimme japanilaisten kollegojen kanssa, heidän aloitteestaan, seminaarin Metadata, Data Catalogues and Tools for Findability.

Kansainvälisen seminaarin taustalla on Japanin kansallinen hanke, jossa he rakentavat usean palveluntarjoajan yhteistä aineistoluetteloa. Japanilaiset vieraat valitsivat Suomen ja Tietoarkiston vierailukohteekseen, koska Tietoarkistolla on pitkä kokemus onnistuneesta kaksikielisten palvelujen tuottamisesta suomeksi ja englanniksi sekä tutkimusaineistojen kuvailutietojen saattamisesta haravoitaviksi kansallisiin ja kansainvälisiin yhteisluetteloihin.

Tietoarkistossa koostimme oman osuutemme ohjelmaan vieraiden tiedontarpeesta lähtien. Tietoarkiston asiantuntijat kertoivat muun muassa DDI-C-kuvailuformaatin hyödyntämisestä Tietoarkistossa, liittymisestä kansallisiin ja kansainvälisiin monitieteisiin luetteloihin, monikielisten asiasanastojen merkityksestä ja hyödyntämisestä sekä CTS-sertifioinnista.

Professori Yukio Maeda esittelee JSPS:n suunnitelmaa yhteiskatalogiksi.
Kuva: Tuomas J. Alaterä

Seminaarissa esiintyivät Tietoarkiston asiantuntijoiden ja japanilaisten vieraiden lisäksi CESSDA ERICin johtaja Ron Dekker ja Ruotsin datapalvelun SND:n järjestelmäarkkitehti Olof Olsson. CESSDAlle on tärkeää luoda yhteistyösuhteita myös Euroopan ulkopuolelle. Tampereen seminaari antoi hyvän mahdollisuuden kertoa CESSDAn strategiasta ja tavoitteista tutkimusdatan vastuullisen avaamisen alalla, unohtamatta CESSDAn aineistoluetteloa, johon myös Tietoarkiston ja SND:n metadata haravoidaan. Ruotsin SND hyödyntää DDI-L-kuvailuformaattia. Olssonin esitys aiheesta tarjosi hyvän vertailukohdan kahden erilaisen metadataratkaisun välillä ja oli kiinnostava myös Tietoarkiston järjestelmäkehityksen näkökulmasta.

Samankaltaiset haasteet

Varsinaisen asiasisällön lisäksi seminaari osoitti kaikille osallistujille, että tutkimusaineistojen hallinnan ja avaamisen ongelmat ovat kaikkialla hyvin samanlaisia. Japanissakin tutkijat suhtautuvat periaatteessa myönteisesti, mutta eivät usein halua jakaa omaa dataansa muiden kanssa. Ja jos he haluavat, he usein tekevät sen mieluummin itse kuin antavat asiaan perehtyneiden ammattilaisten hoitaa tehtävän puolestaan. Tämä on Tietoarkiston aineistonhankinnassa tuttua.

Seminaariosallistujat. Kuva: Misa Senbonmatsu

Kovin tutulta vaikutti myös se, että datainfrastruktuurin rakentamista ei varsinaisesti koordinoida Japanissa kansallisesti. Rahoittaja on avannut kilpailun, josta eri palveluntarjoajat ovat voineet hakea rahoitusta tietyin ehdoin määritellyille hankkeille. Kansallinen kokonaiskuva rakentuu siitä, mitä erilliset organisaatiot pitävät tarpeellisena - ja mitä rahoittaja näistä esityksistä jatkoon valitsee. Perustamisvaiheen ohella pohdittavaa aiheuttaa infrastruktuurin toiminnan vakiinnuttaminen rahoituskauden päättyessä.

Lisätietoa:

» DDI-C ja L -dokumentaatio
» CESSDA ERIC
» Svensk nationell datatjänst SND
» Japan Society for the Promotion of Science JSPS
» Aineistokuvailut koneluettavissa formaateissa
» Aineistokuvailun DDI-formaatti
» Aineistonkuvailussa käytetyt sanastot

Helena Laaksonen
johtaja
etunimi.sukunimi [at] tuni.fi

Tämä blogikirjoitus on luettavissa myös englanniksi:
FSD’s multilingual and qualitative data expertise brings in international visitors.

26. elokuuta 2016

Miten aineistot arkistoituvat Tietoarkistoon?

Kun tutkija tai tutkijaryhmä on lähettänyt tutkimusaineistonsa Tietoarkistoon arkistoitavaksi, varsinainen aineiston käsittelyprosessi vasta alkaa. Arkistoitavaksi toimitettu aineisto kulkee aina aineistonkäsittelijän sormien läpi ennen kuin se julkaistaan palveluportaali Ailassa jatkokäyttöä varten.

Erilaiset tietokoneohjelmat helpottavat, nopeuttavat ja virtaviivaistavat aineiston käsittelyä, mutta loppujen lopuksi aineiston käsittelyyn liittyvän työn tekevät ihmiset eivätkä koneet. Näin pystymme varmistamaan, että mitä moninaisimmat aineistot ovat tulevaisuudessakin tutkimusmaailman käytettävissä yhdenmukaiseksi suunniteltujen ohjeidemme mukaisesti.

Aineistonkäsittelijäntyö on Tietoarkiston ydintyötä, jota ilman Ailassa ei olisi jatkokäyttökelpoisia aineistoja. Tietoarkiston pitkäaikaiset tutkimusapulaiset Eliisa Haanpää (kvantitatiivisten aineistojen käsittely) ja Annika Sallinen (kvalitatiivisten aineistojen käsittely) kertovat, minkälaista aineistonkäsittelijän työ on, ja minkälaisen prosessin aineistot käyvät läpi ennen kuin ne ilmestyvät Ailaan.

Kyselytutkimukset arkistoituvat muuttuja muuttujalta

Eliisa

Aloitan kvantitatiivisen aineiston käsittelyn aina tutustumalla aineistoon, siihen sisältyviin muuttujiin sekä aineistoon liittyvään tutkimusraporttiin ja lisämateriaaliin. Avattuani datatiedoston, tarkastan ensimmäisenä kaikki muuttujat ja varmistan, että käsiteltävä data vastaa kyselylomaketta. Nimeän muuttujat kyselylomakkeen mukaisesti, mihin perustuen määrittelen myös muuttujien selitteet.

Tämän jälkeen arvioin aineiston tunnisteellisuutta ja arkaluontoisuutta, jonka jälkeen teen tarvittavat toimet vastaajien anonymiteetin säilyttämiseksi. Tässä vaiheessa apunani ovat usein Tilastokeskuksen erilaiset alue-, toimiala- ja tieteenalaluokitukset. Lopuksi vielä varsinaista dataa käsitellessäni tarkistan muuttujien frekvenssit suhteessa tutkimusraporttiin.

Käsittelen dataa SPSS:n syntaksin avulla. Numeroista ja loogisesta päättelystä pitävänä ihmisenä syntaksin työstäminen on mielestäni palkitsevaa puuhaa. Syntaksin tekemiseen sisältyy monia yksin ja yhdessä kollegojen kanssa pohdittavia haasteita, useita onnistumisen kokemuksia, kun komennot toimivat toivomallani tavalla ja tietysti työni kannalta tärkein tuotos, jatkokäyttöön valmistuva datatiedosto.

Varsinaisen datan valmistuttua siirryn aineiston kuvailuun, johon kuuluu muuttujien kuvailu sekä aineiston sisällöllinen kuvailu. Tietopankkina sisällöllistä kuvailua tehdessäni käytän tutkimusraporttia ja sieltä löytyviä aineistonkeruuseen liittyviä tietoja. Aineiston (eli datan sekä aineiston kuvailun) käsittelyn valmistuttua kirjaan tietokantaamme "data valmis"-komennon, jonka jälkeen aineisto julkaistaan palveluportaali Ailassa.

Aineistoja käsitellessäni olen oppinut paljon paitsi tilastollisista menetelmistä ja kyselytutkimuksista, myös eri tieteenalojen tutkimusteemoista. Olen tähän mennessä käsitellyt aineistoja liittyen muun muassa lasten ja nuorten mediakäyttäytymiseen, lasten uhrikokemuksiin, suomalaisten hyvinvointiin, eduskuntavaaleihin, asumiseen ja kaupunkikuvaan, opiskeluun sekä vapaaehtoistoimintaan.

Aineiston käsittelyn eri vaiheissa olen yhteydessä yhteen tai useampaan tutkijaan, mikäli tarvitsen aineistosta lisätietoja. Yhteistyö sekä tutkijoiden suuntaan että kollegoiden kanssa on erittäin merkittävässä osassa työskentelyssäni aineistojen parissa.

Kvalitatiivisessa aineistossa tallentuu aina pala aikaa

Annika

Kvalitatiivisten aineistojen arkistointi poikkeaa kvantitatiivisten aineistojen arkistoinnista sikäli, ettei siinä tarvitse pohtia syntaksin komentoja, mutta lukulihaksia työ vaatii senkin edestä. Luemme tänne toimitetuista haastatteluista ja kirjoituksista jokaisen sivun. Tämä täytyy tehdä huolellisesti, että ihmisten tunnistetietoja ei jää luovutettavaan aineistoon. Tekstimassaa saattaa olla yhdessä aineistossa jopa lähes tuhat sivua.

Kvalitatiivisten aineistojen tarkastaminen on siis välillä uppoutumista lukemiseen, mutta työ sisältää myös järjestelmällistä tiedon poimimista sekä järjestelyä ja tietokoneohjelmien kanssa kikkailua - mikä on aina oma taiteenlajinsa.

Dokumentit nimetään järjestelmällisesti. Aineistojen taustatiedot järjestetään yhdenmukaisiksi ja niistä tehdään taustatietohakemisto jatkokäyttäjälle. Työssä käytetään lukuisia ohjelmia, joista tekninen palvelu keskustelee mm. termeillä DDI, HTML ja Python - minä keskityn opettelemaan konkreettisen käytön.

Koko arkistointiprosessin ajan teen muistiinpanoja eteen tulleista ongelmakohdista, niiden ratkaisuista ja vielä tehtävistä vaiheista. Listalla voi olla selvitettävänä, mitä tutkijan kryptinen merkintä muistiinpanoissa tarkoittaa, mihin teollisuusalaan karkeistetaan Suomussalmen Hallan lihajalostamo, sisältävätkö dokumentit piilodataa ja saisiko 400 erillisen tiedoston nimet muutettua automaattisesti toiseen muotoon, jotta kaikkea ei tarvitsisi tehdä käsin.

Kaikkeen löytyy yleensä vastaus, joko kollegoilta, tutkijoilta tai yhdeltä tärkeältä työkaverilta - internetistä. Netti on ollut oiva apu esimerkiksi tilanteessa, jossa oman pään kapasiteetti keksiä suomalaista naisten nimiä on tullut tiensä päätökseen.

Minun mielestäni kvalitatiivisten aineistojen arkistointi on erittäin mielenkiintoista, sillä tutkimusaineistoon perehtyminen on aina oma matkansa jonkin tieteenalan ja alueen tutkimuksen pariin. Aineistoja läpi kahlatessa oppii uusia käsitteitä ja ymmärtää taas elämää eri näkökulmista ehkä hitusen paremmin. Tutkittavat kertovat tutkijalle elämästään asioita, joita eivät muille välttämättä kerro. Työ sisältää myös varjopuolia. Koska kaikki työvaiheet vaativat tarkkuutta ja keskittymistä, silmien ja lukuhermojen ajoittaiselta väsymisiltä ei voi välttyä.

Arkistoinnin loppusuoralla kirjoitetaan vielä nettisivuille tuleva kuvaus aineistosta ja hiotaan aineiston yksityiskohtia. Esimerkiksi taustatietoihin tulee helposti virheitä. Minun tulee myös tarkastaa, että aineistoon on liitetty mukaan tutkimuskutsut, haastattelukysymykset ja muut tarvittavat dokumentit. Lisäksi haastattelukysymykset tulee tallentaa Aila-hakuun. Julkaisun jälkeen menen vielä nettisivuille katsomaan, että aineisto näyttää siellä siltä, miltä sen pitääkin!

Lisätietoa:
» Palveluportaali Aila

Annika Sallinen, tutkimusapulainen, etunimi.sukunimi [at] uta.fi
Eliisa Haanpää, tutkimusapulainen, etunimi.sukunimi [at] uta.fi

13. tammikuuta 2011

Dataintensiivinen tiede tarvitsee oikeanlaista metadataa

Ilman kuvailevaa tietoa, metadataa, sähköinen tutkimusaineisto, data, on merkityksetöntä bittimössöä. Jotta tutkimusaineistoa voidaan hyödyntää nyt ja tulevaisuudessa, tarvitaan tietoa esimerkiksi sen sisällöstä ja rakenteesta sekä mahdollisista muokkauksista ja käyttöoikeuksista. Näitä tarpeita varten eri maiden yhteiskuntatieteelliset data-arkistot kehittivät 1990-luvulla uuden monipuolisen kuvailuformaatin, DDI:n. Aluksi DDI keskittyi tutkimusaineistojen arkistointivaiheessa tarvittavaan metadataan, mutta tuorein versio, DDI 3, kattaa datan koko elinkaaren.

DDI:n käyttäjäkunta laajenee jatkuvasti. Viime vuoden joulukuussa järjestetty 2nd Annual European DDI Users Group Meeting, tuttavallisemmin EDDI, houkutteli talviseen Utrechtiin seitsemänkymmentä tutkimusaineistojen metadatan asiantuntijaa. Osallistujia oli data-arkistojen lisäksi muun muassa akateemisista tutkimusorganisaatioista, kaupallisista ohjelmistoyrityksistä, Eurostatista ja Australian tilastotoimesta. Yhteistä kaikille osallistujille oli halu hyödyntää olemassa olevien ja tulevien tietoaineistojen koko potentiaali ja tahto palvella dataa tuottavia ja käyttäviä sidosryhmiä parhaalla mahdollisella tavalla.

Tietoarkistosta meitä oli Utrechtissä kaksi: minä ja atk-erikoistutkijamme Matti Heinonen. Kaksipäiväisen seminaarin aikana ehdimme saada aimo annoksen sekä käytännön tietoa että uusia ideoita. Matti keskittyi teknisiin sessioihin, minulle jäivät "yleisemmät teemat". Yli kahdenkymmenen toinen toistaan paremman esityksen joukosta kiinnostavimmiksi nousivat mielestäni Peter Wittenburgin ja Steven Valen esitykset.

Max Planck -instituutin kieliarkistoa johtava Peter Wittenburg kertoi tieteellisen datan eurooppalaista e-infrastruktuuria visioineen korkean tason asiantuntijaryhmän työn tuloksista. Tämä HLEG-ryhmä luovutti lokakuussa Euroopan komissiolle loppuraporttinsa "Riding the wave. How Europe can gain from the rising tide of scientific data". Tiede on tällä hetkellä dataintensiivistä: tutkijat elävät suurten datamassojen keskellä ja tutkijoiden käytössä olevan datan määrä kasvaa koko ajan kaikilla tieteenaloilla. Tämä tieteen neljänneksi paradigmaksikin kutsuttu vaihe tarjoaa luonnollisesti runsaasti mahdollisuuksia, mutta esityksessään Wittenburg keskittyi haasteisiin. Datanhallinnan vaatimukset kasvavat kohisten. Esimerkiksi datan säilytysaika ja -strategiat vaihtelevat datan tyypin mukaan. Yleistäen voidaan sanoa, että luonnontieteissä ongelmana on datan määrä, yhteiskuntatieteissä ja humanistisissa tieteissä datan monimutkaisuus. Oikeanlainen metadata on keskeinen datanhallinnan väline.

Wittenburgin puheessa toistui myös sana luottamus: eri toimijoiden datan elinkaaren eri vaiheissa olisi voitava luottaa toisiinsa ja tietysti itse dataan. Tärkeää olisi myös saavuttaa laaja konsensus siitä, että arvokkaan tieteellisen datan laadukas dokumentointi, huolellinen säilyttäminen ja mahdollisimman avoin saatavuus jatkokäyttöön hyödyttävät sekä tiedeyhteisöä että yhteiskuntaa. Haasteet ovat samanlaisia tai ainakin hyvin samankaltaisia (Euroopan) eri maissa ja eri tieteenaloilla, ja ne ovat tuttuja tietoarkistotyön arjestakin.

YK:n Euroopan talouskomission UNECE:n Steven Vale tarkasteli esityksessään datanhallinnan ongelmia tilastojen tuottajan näkökulmasta. Tilastovirastojen yhteistyön helpottamiseksi ja tilastojen laadun parantamiseksi UNECE, Eurostat ja OECD:n METIS-työryhmä ovat tuottaneet tilastollisten metadatajärjestelmien perustietopaketin (the Common Metadata Framework). Paketin ehkä mielenkiintoisinta antia on tilastotuotannon yleinen prosessimalli GSPBM (Generic Statistical Business Process Model), jonka avulla voidaan vertailla, tutkia ja kehittää sekä organisaation sisäisiä että organisaatioiden välisiä prosesseja. Kuten Valekin toi esille, GSPBM:llä on huomattavia yhtäläisyyksiä DDI 3:n pohjana olevan elämänkaarimallin kanssa.

Tilastotuotanto ei yleensä etene suoraviivaisesti suunnittelusta jakeluun, joten GSPBM ole lineaarinen malli, vaan prosessimatriisi. Sen avulla voi kuvata monimutkaisiakin tilastotuotantoprosesseja. Teoreettinen GSBPM-malli ei kuitenkaan riitä; lisäksi tarvitaan muun muassa työkaluja ja metadataformaatteja. Ongelmana on, että ei ole olemassa sellaista metadatastandardia, joka kattaisi GSBPM:n kaikki prosessit. Vale heittikin pohdittavaksi ajatuksen DDI:n ja tilastotiedon siirto- ja kuvailuformaatin SDMX:n toisiaan tukevasta käytöstä prosessin eri vaiheissa.

Useamman jo olemassa olevan ja toisiaan tukevan "täsmästandardin" käyttö kuulostaa kieltämättä järkevämmältä kuin yhden ison kaikenkattavan ja siten väistämättä hyvin monimutkaisen standardin rakentaminen.

Virallisen ohjelman jälkeen vapaamuotoinen keskustelu jatkui iltamyöhään. Tilaisuus oli käytettävä hyväksi, sillä näin suurta joukkoa tutkimusaineistojen metadatasta ja tiedonhallinnasta innostuneita eturivin asiantuntijoita tapaa vain harvoin! Seuraavassa EDDI-seminaarissa ensi syksynä Göteborgissa voimme toivottavasti esitellä tutkimusinfrastruktuuriimme kehittämiseen saamamme lisärahoituksen avulla toteutettavia parannuksia palveluihimme ja käytäntöihimme.

Mari Kleemola
Tietopalvelupäällikkö
DDI Alliance Expert Committee Vice Chair
etunimi.sukunimi [at] uta.fi