Näytetään tekstit, joissa on tunniste jatkokäyttö. Näytä kaikki tekstit
Näytetään tekstit, joissa on tunniste jatkokäyttö. Näytä kaikki tekstit

18. maaliskuuta 2026

Strategisesti fokusoitua yhteistyötä

Tietoarkiston missiona on jakaa, vaalia ja säilyttää pitkäaikaisesti käyttökuntoisena suomalaisen yhteiskunnan, ihmisten ja kulttuuristen ilmiöiden tutkimiseksi kerättyä tutkimusdataa. Toimintaamme ohjaa valtakunnallisen neuvottelukuntamme hyväksymä strategia. Sen mukaisesti tuotamme yhteentoimivia, luotettavia ja vaikuttavia palveluita sekä kehitämme alan parhaita käytäntöjä yhteistyössä muiden toimijoiden kanssa.

Yhteistyö- ja vaikuttamisympäristömme onkin laaja. Keskeiset yhteistyötahomme on koottu oheiseen kuvioon, joka asemoi Tietoarkiston tutkimuksen ja avoimen tieteen kokonaisuuteen sekä kansallisesti että kansainvälisesti.

Kuvio: Tietoarkiston yhteistyötahot.

Asiakkaistamme suurin osa tulee tiedeyhteisöstä, erityisesti kotimaisista yliopistoista. Merkittävä osa on yhteiskuntatieteilijöitä, mutta Tietoarkisto palvelee aivan kaikkia tieteenaloja. Käyttäjäyhteisömme voidaan jakaa kahteen ryhmään: aineistojen luovuttajat (tallentajat) sekä aineistojen ja palveluiden käyttäjät. Aineistoja luovuttavat arkistoitaviksi yksittäiset tutkijat, tutkimusryhmät, yliopistot, tutkimusorganisaatiot, tiedonkeruuorganisaatiot, ministeriöt, kolmannen sektorin toimijat sekä yritykset. Käyttäjiä ovat kaikki, jotka lataavat ja hyödyntävät aineistoja Ailasta tai käyttävät muita Tietoarkiston palveluita.

Suuri osa käyttäjistämme on tutkijoita, opettajia ja opiskelijoita. Avoimesti saatavilla olevat aineistot ovat myös esimerkiksi kansalaisten, julkisen sektorin, median, yritysten ja kolmannen sektorin käytettävissä. Vuonna 2026 Ailassa oli yli 7000 rekisteröitynyttä käyttäjää, joista suurin osa oli suomalaisista korkeakouluista.

Ihmisten lisäksi palvelemme enenevässä määrin myös konekäyttäjiä. Tietoarkiston metadata haravoidaan muun muassa kotimaiseen Etsin-palveluun ja kansainvälisiin aineistoluetteloihin kuten CESSDAn datakatalogiin.

Kansainvälistä yhteistyötä aineistojen keruussa ja aineistopalveluissa

Keskeinen yhteistyökumppanimme onkin CESSDA ERIC (Consortium of European Social Science Data Archives), joka on eurooppalaisten yhteiskuntatieteellisten tietoarkistojen muodostama tutkimusinfrastruktuuri. Suomi on CESSDAn jäsen ja Tietoarkisto CESSDAn Suomen kansallinen palveluntuottaja (Service Provider, SP). CESSDA-yhteistyössä kehitetään keskitettyjä palveluja, jaetaan työkaluja ja vaikutetaan tutkimus- ja tiedepolitiikkaan. CESSDA ja sen kansalliset palveluntuottajat osallistuvat aktiivisesti myös EOSC kokonaisuuden kehittämiseen erilaisissa EU-hankkeissa.

Tietoarkisto on mukana neljässä kansainvälisiä vertailuaineistoja tuottavassa tutkimuksessa. International Social Survey Programme (ISSP) - ja European Values Study (EVS) -ohjelmissa Tietoarkisto koordinoi datankeruuta ja vastaa Suomen datan arkistoinnista ja jakelusta. Lisäksi tarjoamme suomalaiselle tutkimusyhteisölle pääsyn luotettaviin vertailuaineistoihin Michiganin yliopiston yhteydessä toimivan ICPSR:n (Inter-university Consortium for Political and Social Research) ja Luxemburgissa toimivan LIS-datakeskuksen kautta.

Standardointi, tiedepolitiikka ja kansalliset verkostot palveluiden parantamiseksi

Olemme myös aktiivisia standardoinnin ja tiedepolitiikan kentillä sekä kotimaassa että kansainvälisesti. Asiantuntijamme osallistuvat alamme metadatastandardien kehittämiseen DDI-allianssissa ja luotettavan pitkäaikaissäilytyksen standardien luomiseen sekä repositorioiden sertifiointiin CoreTrustSeal- verkostossa. Lisäksi olemme mukana eurooppalaisissa hankkeissa rakentamassa EOSCia ja yhteiskuntatieteellis-humanistisia palveluja SSHOC-yhteistyössä. Kansallisesti Tietoarkisto osallistuu muun muassa avoimen tieteen koordinaatioon ja asiantuntijaryhmiin. Hyödynnämme CSC:n tuottamia kansallisia palveluita, kuten Fairdata- ja PAS-palveluja. Kotimaassa verkostoihimme kuuluvat myös kansalliset tutkimusinfrastruktuurit, kuten ESS, SHARE, FIN- CLARIN ja FIRIPO.

Tampereen yliopisto on Tietoarkiston omistajaorganisaatio. Tampereen korkeakouluyhteisön tutkijat, opettajat ja opiskelijat sekä datanhallinnan asiantuntijat muodostavat merkittävän osan Tietoarkiston käyttäjäyhteisöstä. Yliopiston sisällä Tietoarkisto tekee tutkijoiden lisäksi yhteistyötä muun muassa kirjaston, IT-palveluiden ja hallinnon palveluiden kanssa. Tietoarkisto tuo korkeakouluyhteisöön datanhallinnan ja pitkäaikaissäilyttämisen asiantuntemusta sekä resursseja muun muassa EU-hankerahoituksen kautta.

Kaiken yhteistyön tavoitteena on parantaa tutkijoille tarjottavia palveluita, varmistaa arvokkaiden tutkimusaineistojen käytettävyys ja saatavuus nyt ja tulevaisuudessa, vahvistaa Tietoarkiston osaamista sekä välttää päällekkäistä työtä. Haluamme myös viedä hyviä suomalaisia datanhallinnan käytäntöjä maailmalle sekä edistää tutkimuksen vastuullista avoimuutta, käytäntöjen läpinäkyvyyttä sekä metadatan, datan ja palveluiden yhteentoimivuutta.

Lisätietoa:

Mari Kleemola
Kehittämispäällikkö, varajohtaja
etunimi.sukunimi [at] tuni.fi

10. lokakuuta 2025

Tietoarkisto-seminaari 2025: ISSP Suomessa 25 vuotta

International Social Survey Programme (ISSP) on maailmanlaajuinen vertailututkimusohjelma, joka on koonnut tietoja eri maiden kansalaisten toiminnasta ja yhteiskunnallisista mielipiteistä jo vuodesta 1985 saakka. Suomi on ollut mukana vuodesta 2000. Suomen ISSP-jäsenyys on järjestetty eri organisaatioiden yhteistyönä. Tietoarkisto arkistoi suomenkieliset Suomen aineistot ja mukana aineistonkeruussa ovat Tampereen yliopiston yhteiskuntatieteiden tiedekunta ja keruun toteuttavat organisaatiot.

ISSP-tutkimusohjelman 25-vuotiaan taipaleen kunniaksi järjestimme 7.10.2025 kansallisen Tietoarkisto-seminaarin. Seminaari pidettiin hybridimuotoisena sekä verkossa että Tampereen yliopiston Väinö Linna –salissa. Tapahtuma oli maksuton ja avoin kaikille aihepiiristä kiinnostuneille.

Seminaarin teemat kytkeytyivät ISSP:n menneisyyteen, tähän hetkeen sekä tulevaisuuteen erilaisten mielenkiintoa herättäneiden puheenvuorojen myötä. Seminaarissa kuultiin myös tarkemmin muutamista tuoreista ISSP-aineistoista.

Seminaariin ilmoittuneita oli yhteensä 66. Mukana oli monipuolinen joukko seminaariväkeä, kuten perus- ja jatkotutkinto-opiskelijoita, lehtoreita, opettajia, professoreita, tutkimusjohtajia, tutkimusinsfraktuurin edustajia sekä tutkimuksen tuen asiantuntijoita. Tällä kokoonpanolla seminaarissa keskustelua syntyikin puheenvuorojen jälkeen mukavasti. Niissä korostui innostuneisuus ja yhteistyön sekä asiantuntijuuden tärkeys.

Harri Melin (vas.), Eriikka Oinonen ja Henna Kaartinen tarkastelevat, millainen on tosi suomalainen ISSP-aineiston ja tekoälyn näkemänä.

Tilaisuus päättyi kahvitukseen, jossa keskustelu Tietoarkisto-seminaarin aiheista jatkui täytekakun ja kahvien merkeissä.

Tietoarkistossa jatkamme ISSP-tutkimusohjelman taivalta. Tuorein aineisto on juuri ennen seminaaria Ailassa julkaistu: FSD3994 ISSP 2024: digitaalinen yhteiskunta: Suomen aineisto. Aineisto sisältää suomalaisten näkemyksiä digitaalisesta yhteiskunnasta sekä internetin ja digitaalisen teknologian käytöstä.

Ohjelma

Jaetut esitykset ovat saatavilla seminaarin verkkosivulla.

  • Avauspuheenvuoro. Johtaja Helena Laaksonen (Tietoarkisto)
  • Four Decades of ISSP: Past, Present, Future. Prof. Dr. Stephanie Steinmetz, (FORS – Swiss Centre of Expertise in the Social Sciences)
  • Suomi 25 vuotta ISSP:ssä - Pysyvätkö kansalaiset mukana? Tutkimuspäällikkö Sami Borg (Kunnallisalan kehittämissäätiö)
  • Tauko
  • Kansallinen identiteetti maailman onnellisimmassa maassa. Yliopistonlehtori Eriikka Oinonen ja professori emeritus Harri Melin (Tampereen yliopisto)
  • Digitaalinen eriarvoisuus ja irtikytkeytyminen. Professori Semi Purhonen (Tampereen yliopisto)
  • Suomalaiset ja työ 2000-luvulla. Tietoasiantuntija Emilia Hakkola (Tietoarkisto)
  • Keskustelua ja loppusanat

Henna Kaartinen
projektiassistentti
etunimi.sukunimi [at] tuni.fi

14. helmikuuta 2025

Rakasta dataa! Love Data Week muistutti, että datasta pitää pitää huolta

piirroshahmo, jolla käsissään sydän, jossa teksti Data.
Olemme taas viettäneet dataintoilijoiden kansainvälistä teemaviikkoa. Love Data Week 2025 kysyi ja hieman vastasikin sangen yleiseen ongelmaan "Whose data is it anyway", eli kenen dataa se nyt oikein on? Tietoarkistossa puhumme mielellämme omista datoistamme ja ehkä tekin puhutte Tietoarkiston datoista. Datat eivät kuitenkaan ole meidän, koska sopimusten mukaisesti huolehdimme datoista tekijöiden ja omistajien puolesta.

Metadata sen sijaan on Tietoarkiston tuottamaa, "meidän dataamme" siis. Se on avoimesti saatavilla Creative Commons Nimeä 4.0 Kansainvälinen -lisenssin mukaisesti.

Love Data Weekin järjestää ICPSR. Tapahtumista ja viikon aikana jaetuista tietolähteistä voit lukea lisää tapahtumasivuilta. Tietoarkisto osallistui viikon teemaan sosiaalisen median nostoilla, joissa toimme esiin palveluita ja tietolähteitä, joiden kautta Tietoarkisto ohjeistaa datan omistamisesta tai tekijyydestä sopimiseen. Tähän blogiin on koottu kaikki nämä nostot.

Sopiminen, kun tutkijoita on useita

Jos tutkimushankkeessa on useita tutkijoita, kannattaa hoitaa oikeuksista sopiminen ajoissa, jotta ei tarvitsisi miettiä jälkikäteen, "kenen dataa se nyt oikein on?" Ohjeita saat muun muassa Tietoarkiston Aineistonhallinnan käsikirjan luvusta Sopimukset ja oikeudet.

Tekijä ei ole aina henkilö

Koronapandemian aikana kerätyt tutkimusdatat ovat ajankohtaisia myös nyt. Pandemia osoitti, että yhteiskunnan kriisitilanteissa ilmiötä käsittelevät tutkimusaineistot pitää saada käyttöön joustavasti ja avoimesti. Tutkimusaineistolla ei aina myöskään ole henkilötekijää, vaan se voi olla myös organisaation tuottama. Näistä esimerkkinä on tammikuussa 2025 julkaistu gerontologisen sosiaalityön ja diakoniatyön asiakkaiden sekä ikääntyvien parissa työskentelevien haastatteluaineisto.

Aineistoviite: Helsingin yliopisto & Itä-Suomen yliopisto & Lapin yliopisto: Gerontologisen sosiaalityön ja diakoniatyön asiakkaiden sekä ikääntyvien parissa työskentelevien haastatteluja 2021 [data]. Dataversio 1.0 (2024-09-12). Yhteiskuntatieteellinen tietoarkisto [jakaja]. DOI: https://doi.org/10.60686/t-fsd3862; URN: https://urn.fi/urn:nbn:fi:fsd:T-FSD3862

Aineisto voi jäädä orvoksi

Kenelle kuuluu orpo aineisto? Arja Kuula-Luumi kirjoitti orvoista aineistoista blogin jo yli kymmenen vuotta sitten.

Tuolloin Tietoarkistossa uudistettiin ja yksinkertaistettiin arkistointisopimuksia. Nykyiseen verrattuna Tietoarkistossa oli tuolloin runsaasti dataa, jonka käyttöön piti pyytää alkuperäisen tutkijan tai luovuttajan lupa. Halusimme vähentää näin rajoitettua käyttöä ja lisäksi muuttaa luvanvaraisuuden määräaikaiseksi. Määräaikaisuutta voi karuimmillaan perustella sillä, että aineistosta tulee orpo, kun luvanantaja kuolee eikä vaihtoehtoista toimintatapaa ole määritelty. Aineisto voi kuitenkin jäädä orvoksi myös silloin, kun luvanantaja jostain muusta syystä ole enää tavoitettavissa.

Arkistointiohjeissa kerromme datojen käyttöoikeusluokista.

Kenen data?

Joskus tutkittaville syntyy tekijänoikeuksia tutkimusta varten kerättyyn aineistoon. Näin voi tapahtua, jos tutkittavat esimerkiksi piirtävät tai valokuvaavat tai tuottavat tekstiä, josta tutkija muodostaa aineistonsa. Lue Tietoarkiston Aineistonhallinnan käsikirjasta, mitä sinun pitää ottaa huomioon näin kerättyä aineistoa hyödyntäessäsi ja millaiset sopimukset ovat tarpeen.

Tietoarkisto vaalii huomassaan olevaa dataa jokaisena päivänä – ole yhteydessä asiakaspalveluumme tai täytä arkistointiehdotuslomake, kun datasi kaipaa rakkautta!

suorakaide, jossa teksti Love Data Week.

Helena Laaksonen
johtaja

Tuomas J. Alaterä
palvelupäällikkö

etunimi.sukunimi [at] tuni.fi

3. marraskuuta 2022

Let’s Keep It FAIR

The acronym FAIR cannot be avoided when talking about research data. And that’s good. FAIR stands for better discoverable and accessible research data, documented and published in a way that makes it reusable and understandable by both humans and machines. At least those are the benefits. Viewed from the repository world and with digital preservation glasses on, FAIR research data should also be curated data that have found a home in a repository where the designated user community knows to look for it. This can be greatly facilitated by improving the repository's ability to produce and preserve FAIR (meta)data.

During the last three years, FSD has led the work in the EOSC-Nordic project's work package on FAIR and repository certification support. In addition to sound digital preservation practices, we found that rich, standards-based metadata, documented processes, and a clear mission in digital preservation are essential to keeping data FAIR. Money also helps, but it cannot buy love or eternal existence if expertise is lacking. Therefore, improving the repository's ability to produce and preserve (meta)data is one key step towards FAIRer and more trusted data sharing.

Landscaping the Nordic countries and the Baltics

To better understand the Nordic and Baltic research data repository landscape, the working group conducted a desk study to examine the characteristics of the data repositories in the region. This was done using publicly available information on 86 repository websites. A significant majority were specialist repositories focused on specific fields or disciplines, while the rest were generalist repositories.

We were interested in what information about the repository itself was easily accessible to users and other stakeholders because conveying trust is crucial. We were looking for information that is essential for understanding the services and reusing data: mission statement, description of the designated community, methods of data preservation, model citations, use of PIDs and terms of use.

Almost three out of four repositories had a mission statement and about half of them had a description of the designated community. Almost half specifically mentioned being responsible for long-term preservation. A little more than half provided a model citation for their data. Over three fourths had the terms of data use available on their websites. The content and scope varied between repositories.

Common repository registries, such as re3data and FAIRsharing, help users find suitable repositories and provide an overview of existing services. As many as 72% of the repositories in our sample had a record in re3data, while only 22% had a record in FAIRsharing. All repositories that had a FAIRsharing record also had a re3data record. This suggests that currently re3data is considered the most important registry for repository information.

Repository certification

We are also looking for information about the repository certifications. Only 17 (20%) of the repositories mentioned certification on their website. The most common certificate was CoreTrustSeal (CTS). Other certificates mentioned were the CLARIN certificate, ISO 27001 and WDS. Currently, there are relatively few CTS-certified repositories in the Nordic countries and the Baltics compared to Western Europe. Support and training for CoreTrustSeal self-assessments offered during the EOSC-Nordic project is expected to pump the number of certified repositories from ten to 15 or 16.

Although the certification alone does not preserve a single byte, it seems that support, networking, and awareness raising over the past couple of years in the EOSC-Nordic project have helped the players in their game to keep the data FAIR.

---

This blog entry is partially based on the final report of the work package. Deliverable D4.5 Report on completed FAIR data standard adoption and certifications of data repositories in the region is forthcoming.

Today is the World Digital Preservation Day. Follow what's happening around the world!

More information:
» World Digital Preservation Day
» World Digital Preservation Day Events Calendar
» EOSC-Nordic Knowledge Hub (Final report will be here when published)

Tuomas J. Alaterä
Senior Specialist (Web Services, Digital Preservation and Communications)
firstname.surname [at] tuni.fi

7. lokakuuta 2022

60-vuotias ICPSR palvelee myös suomalaisia

Yhdysvaltalainen data-arkistoinnin uranuurtaja Inter-university Consortium for Political and Social Research, lyhemmin ICPSR, viettää 60-vuotisjuhlavuottaan. Toimintansa alkumetreiltä lähtien Tietoarkisto on mahdollistanut suomalaisten pääsyn ICPSR:n aineistoihin. Siellä on runsaasti juuri amerikkalaista mutta myös kansainvälistä tutkimusaineistoa. Luettelossa on lähes 18 000 tutkimusta, sekä historiallista että viimeaikaista aineistoa.

Amerikkalaisen yhteiskunnan ja väestön tutkijalle ICPSR on ehdoton tiedonlähde. Jos olet kiinnostunut jostakin muusta Euroopan ulkopuolisesta maasta, on syytä tarkistaa, mitä ICPSR:n luettelossa on löydettävissä. Vaikkapa Kiinaa, Intiaa tai latinalaista Amerikkaa tutkivan kannattaa tutustua aineistoihin – vain joitakin esimerkkejä mainitakseni.

ICPSR:n suomalaisten asiakkaiden taustat ovat useimmiten taloustieteissä. Myös sosiaalitieteilijät, psykologit, humanistit ja historian tukijat ovat ladanneet dataa. Tarjolla on kuitenkin aineistoa huomattavasti laajemminkin eri aloille, kuten terveystieteen, kasvatustieteen tai politiikan tutkijalle.

ICPSR:n alla toimii myös joukko temaattisia data-arkistoja, kuten National Archive of Data on Arts and Culture, National Archive of Criminal Justice Data tai Resource Center for Minority Data.

Yksittäinen aineiston lataaja selviää maksuitta

Tietoarkiston maksamalla jäsenmaksulla kaikkien Suomen yliopistojen opiskelijat ja henkilökunta voivat käyttää ICPSR:n palveluja. Aineiston lataajien joukossa onkin sekä opiskelijoita että tutkijoita. Käyttöoikeuden tunnistamisessa hyödynnetään yliopistojen IP-osoitteita. Jos et onnistu kirjautumaan ohjeita noudattaen, ota yhteyttä Tietoarkistoon. Tarkempia ohjeita saat Tietoarkiston ICPSR-sivulta.

ICPSR järjestää myös kesäkouluja, verkkokoulutusta ja -tapahtumia. Osa tapahtumista on maksuttomia ja osa maksullisia, kuten kesäkoulut. Verkkosivuilla on runsaasti koulutusmateriaalia. Tarjolla on muun muassa ICPSR:n aineistoja hyödyntäviä oppaita ja harjoituksia opetustilanteisiin ja itseopiskeluun.

Viime kuussa ICPSR järjesti Data Fair -tapahtuman kokonaan verkossa. Maksuttoman tapahtuman esitykset on julkaistu ICPSR:n YouTube-kanavalla. Niiden kautta pääsee helposti tutustumaan ICPSR:n tarjontaan esimerkiksi, palveluihin, teema-arkistoihin tai datan kuratoinnin kehityskaareen.

Lisätietoa:

Helena Laaksonen
johtaja, ICPSR Official Representative
etunimi.sukunimi [at] tuni.fi

14. helmikuuta 2022

Datarakkautta ilmassa ja tutkimusaineistojen jatkokäyttö huipussaan

Love Data -viikko1 on taas käsillä. Teemana tänään ystävänpäivänä alkavalla viikolla on ”data kuuluu kaikille!” (Data is for everyone). Meillä Tietoarkistossa huolehditaan tänne tallennetun tutkimusdatan saatavuudesta. Saatavuus-sana pitää sisällään sekä säilytyksen että datan löydettävyyden ja pääsyn siihen.

Kaikki aineisto ei ole kuitenkaan kokonaan kaikkien saatavilla. Käyttöehdot rajoittavat jatkokäyttäjien piiriä. Toisaalta Tietoarkiston julkaisemista aineistoista on avoimesti saatavilla niin paljon yksityiskohtaista kuvailutietoa, että ihan jokainen voi halutessaan saada hyvän käsityksen vaikkapa siitä, suhtautuvatko ihmiset epäilevästi kaikkiin uutisiin valeuutisten takia3. Asia selviää Kirkon tutkimuskeskuksen Suomalaisten henkinen kriisinkestävyys -aineiston muuttujakuvailusta, vaikka varsinaisen datan voi saada vain tutkimukseen, opetukseen tai opiskeluun.

Tietoarkiston aineistoluettelon noin 1700 aineistosta on vapaasti saatavilla 109 aineistoa. Nämä aineistot voi ladata rekisteröitymättä, ja niitä voi käyttää mihin tahansa haluamaansa lailliseen tarkoitukseen Creative Commons -lisenssillä . Lähde on silti mainittava ja merkittävä tehdyt muutokset. Aiemmin lataajilta pyydettiin tieto käyttötarkoituksesta ja sähköpostiosoite tilastointia varten. Creative Commons Nimeä 4.0 Kansainvälinen -lisenssiä3 aloimme käyttää vuoden 2020 joulukuussa.

Vapaasti käytettävien aineistojen määrä on alle kymmenesosa kaikista Tietoarkiston aineistoista, mutta niitä ladataan eniten. Kaksi kulunutta koronavuotta ovat olleet arkistoitujen aineistojen jatkokäytössä huiman kasvun aikaa. Vuoden 2021 kasvua vauhditti mainittu lisenssimuutos. Kyseisten aineistojen latausmäärä kasvoi yli tuhannella vuodessa. Aineistojen käyttötilastojen muutoksia on julkaistu Tietoarkiston tiedotteessa4. Kulunut tammikuu 2022 on jälleen kaikkien aikojen vilkkain tammikuu ainakin aineistojen latausten perusteella.

Vaikka data kuuluu kaikille ja suuret aineistojen latausmäärät ilahduttavat, Tietoarkisto on ensisijaisesti tutkimuksen tuki-infrastruktuuri. Aineistot ovat niin avoimia kuin ne voivat olla, ja rajoituksille on perusteet. Meidän on tavoiteltava paitsi suuria käyttäjämääriä, myös huolehdittava aineiston soveltuvuudesta tutkimustarkoituksiin. Tavoitteet eivät aina kohtaa, mutta datan sisältämä tieto kuuluu kaikille, olipa pääsy siihen avointa tai ei.

Iloista Love Data -viikkoa! Lataa dataa Ailasta!

Lisätietoa:

1 Join us for Love Data Week 2022! “Data is for everyone” starts February 14.
2 Kirkon tutkimuskeskus: Suomalaisten henkinen kriisinkestävyys II 2020 [sähköinen tietoaineisto]. Versio 1.0 (2021-09-14). Yhteiskuntatieteellinen tietoarkisto [jakaja]. http://urn.fi/urn:nbn:fi:fsd:T-FSD3509. Muuttuja [q3_3].
3 Creative Commons Nimeä 4.0 Kansainvälinen (CC BY 4.0)
4 Aineistojen käyttö kasvoi huimasti myös toisena koronavuonna: latausten kärjessä avoimesti lisensoidut datat

Helena Laaksonen
johtaja
etunimi.sukunimi [at] tuni.fi

4. toukokuuta 2021

Arkistoidut aineistot tukevat tutkimuksen toistettavuutta

Toistettavuus on tieteellisen tutkimuksen perusperiaatteita. Se tarkoittaa, että tutkija itse tai hänestä riippumaton taho kykenee toistamaan kokeen tai tutkimuksen. Näin voidaan selvittää, kuinka tutkimustuloksiin on päädytty, onko kokeessa mahdollisesti virheitä tai koetuloksissa satunnaisvaihtelua, ja edistää siten tutkimuksen luotettavuutta ja läpinäkyvyyttä.

CSC järjesti 23. huhtikuuta webinaarin, jossa käsiteltiin tutkimuksen toistettavuutta eri näkökulmista sekä esiteltiin toistettavuutta edistäviä työkaluja.

Toistettavuus edellyttää, että tutkimuksen vaiheista on saatavilla tarpeeksi tietoa. Lisäksi tutkimusaineiston on oltava myös muiden kuin alkuperäisen tutkijan saatavilla. Hyvä aineistonhallinta onkin keskeisessä osassa toistettavuuden edistämisessä. Mitä paremmin aineiston keruu ja muokkaaminen sekä sen analysointiin käytetyt menetelmät, ohjelmistot ja ohjelmistoympäristöt on dokumentoitu, sitä helpompi tutkimus on toistaa. FAIR-periaatteiden (löydettävyys, saavutettavuus, yhteentoimivuus ja uudelleenkäytettävyys) soveltaminen tutkimuksen koko elinkaaren ajan edistää tutkimuksen toistettavuutta.

Tutkimuksen toistettavuutta tukee myös aineiston arkistoiminen luotettuun, pitkäaikaissäilytykseen erikoistuneeseen ja jatkokäytön mahdollistavaan arkistoon. Tietoarkisto edistää ihmistieteiden aineistojen saatavuutta ja löydettävyyttä tarkistamalla arkistoitavat aineistot yksityiskohtaisesti, kuvailemalla aineistot ja niihin tehdyt muutokset yksityiskohtaisesti ja kontrolloituja sanastoja käyttämällä, tarjoamalla aineistojen metatiedot avoimesti CC BY 4.0 -lisenssillä ja antamalla aineistoille pysyvät tunnisteet.

Data Stewards by The Turing Way Community, & Scriberia. CC BY 4.0

Nämä kaikki edistävät FAIR-periaatteiden toteutumista. Periaatteet edellyttävät myös metatiedon koneluettavuutta. Tietoarkiston aineistokuvailut ovatkin saatavissa myös ohjelmallisten rajapintojen kautta.

Hyödyntämällä arkistoitua aineistoa tutkimuksessaan tutkija voi luottaa siihen, että tutkimusaineisto on tiedeyhteisön saatavilla kattavasti dokumentoituna. Tutkija säästää aikaa ja vaivaa, ja voi keskittyä dokumentoimaan aineiston käsittelyyn, menetelmällisiin valintoihin ja tuloksiin liittyviä asioita.

Anonymisointi voi muodostua haasteeksi toistettavuudelle

Webinaarissa käsiteltiin toistettavuutta yleisesti ja hiukkasfysiikan tapausesimerkin kautta. Toistettavuuden periaate pätee kaikilla tieteenaloilla, mutta ihmistieteissä tunnisteellisten tutkimusaineistojen anonymisointi luo omat haasteensa aineiston jatkokäytölle ja tutkimuksen toistettavuudelle.

Sensitiivisestä ja tunnisteellisesta aineistosta on usein tarpeen karkeistaa tai poistaa suoria tai epäsuoria tunnisteita. Jatkokäyttöön tulevalla aineistolla ei välttämättä voi toteuttaa alkuperäisten tutkijoiden tekemiä analyysejä sellaisenaan.

Hyvin ja ajoissa suunniteltu aineistonhallinta auttaa tässäkin: kun tutkittavilta kerätyt henkilötiedot on minimoitu ja heitä on informoitu aineiston jatkokäytöstä, aineisto voidaan arkistoida mahdollisimman vähin muutoksin.

Ihanteellisessa tapauksessa tutkimusaineisto on avoimesti tiedeyhteisön saatavilla tulosten koettelemiseksi, mutta joskus aineistoa ei voi avata edes rajoitetusti. Syitä voivat olla esimerkiksi siihen sisältyvät tunnisteet, aineiston arkaluonteisuus, tai että aineisto sisältää liiketoiminnan kannalta salassa pidettävää sisältöä. FAIR-periaatteiden noudattaminen ei edellytäkään aineiston avointa saatavuutta, vaan itse aineisto voi olla rajoitettua tai jopa kokonaan salattua. Periaatteiden mukaista sen sijaan on, että rajoitetusta tai salatusta aineistosta on saatavissa metatietoa, joka kuvaa sen rakennetta, kohdetta, keruutapaa, sovellettuja menetelmiä ja malleja sekä hallinnointia tutkimusprojektin aikana.

Tutkimuksen ja aineistosta tehtyjen johtopäätösten läpinäkyvyyden kannalta on suositeltavaa avata aineistosta vähintään kattavat kuvailutiedot, kuin säilyttää kaikki tiedot muun tiedeyhteisön tai yhteiskunnan ulottumattomissa.

Lisätietoa:

» CSC:n webinaari 23.4.2021: Mitä tutkimuksen toistettavuus tarkoittaa?

» Aineistonhallinnan käsikirja

Data Stewards -kuva (2020, March 3). Illustrations from the Turing Way book dashes. Zenodo. http://doi.org/10.5281/zenodo.4323154

Henri Ala-Lahti
tietoasiantuntija

Tuomas J. Alaterä
erityisasiantuntija

etunimi.sukunimi [at] tuni.fi

23. maaliskuuta 2021

Palveluita tutkimuksen tueksi kehitetään hankeyhteistyöllä

Tietoarkisto osallistuu jatkuvasti useisiin erilaisiin kehityshankkeisiin. Hankkeissa kehitetään nykyisiä palveluita ja suunnitellaan uusia tutkijoille sekä tutkimuksen tueksi. Hanketyössä pyritään löytämään ratkaisuja eri toimijoiden yhteisiin tarpeisiin. Eurooppalaisten yhteiskuntatieteellisten tietoarkistojen tutkimusinfrastruktuuri CESSDAn palveluntuottajana Tietoarkisto osallistuu aktiivisesti sen moniin työryhmiin ja projekteihin. Lisäksi Tietoarkisto tekee yhteistyötä muiden kansainvälisten ja kansallisten tahojen kanssa.

Monet tietoarkistolaiset osallistuvat hankkeisiin eri tavoin. Hanketyö on arkipäivää erityisesti Projektit ja kehittäminen -moduulin jäsenille, joiden työajasta suurin osa kuluu hanketehtävien parissa. Kehittämispäällikkö Mari Kleemola ja erityisasiantuntija Taina Jääskeläinen kertovat hanketyön arjesta sekä kuulumisia hankkeista, joihin he osallistuvat.

Mihin hankkeisiin osallistut ja mitä niissä tehdään?

Mari: Osallistun SSHOC- (Social Sciences & Humanities Open Cloud) ja EOSC Nordic (European Open Science Cloud) -hankkeisiin sekä CESSDAn Trust-projektiin. Lisäksi toimin CESSDAn Tools-työryhmän vetäjänä.

– Näillä hankkeilla on rinnakkaisia tehtäviä, joilla on synergiaetuja. Esimerkiksi SSHOC- ja CESSDA Trust -hankkeissa edistetään luotettujen aineistovarantojen sertifiointia tukemalla data-arkistoja sähköisten aineistojen luotettavassa säilytyksessä ja laadun takaamisessa. Olen CoreTrustSeal-sertifikaatin johtokunnan jäsen ja minulle on kertynyt sertifiointiin liittyvää asiantuntemusta, jota voin tuoda hankkeisiin. Hankkeista puolestaan saadaan palautetta, jota voidaan käyttää sertifioinnin ja data-arkistojen kehittämisessä.

– EOSC Nordic ja SSHOC -projekteissa sekä Tools-työryhmässä kehitetään myös uusia palveluita ja parannetaan aineistojen ja niiden kuvailutietojen yhteentoimivuutta. Kaikilla hankkeilla on yhteisenä tavoitteena Euroopan avoimen tieteen pilvipalvelun eli EOSCin rakentaminen.

Taina: Yli puolet työajastani kuluu CESSDAn hankkeisiin. Toimin sekä CESSDAn aineistoluettelon että sanastopalvelun sisältövastaavana. Rooliin kuuluu ohjausryhmän vetäminen, käyttäjien edustaminen, vaatimusmäärittely, yhteistyö teknisen puolen vastuuhenkilöiden kanssa, tiedottaminen, sidosryhmäyhteistyö ja monenlainen toiminnan sujuvuuden varmistaminen. Lisäksi osallistun monikielisen ELSST-asiasanaston (European Language Social Science Thesaurus) sisällön kehittämiseen ja koulutan kaikki sen kääntäjät.

– CESSDAn aineistoluettelossa on 15 kansallisen palveluntuottajan julkaisemat tutkimusaineistokuvailut, joita on tällä hetkellä yli 30 000. Se on erinomainen lähde löytää yhteiskuntatieteellisiä ja joitakin terveystieteellisiä tutkimusaineistoja eri maista. Luettelosta on julkaistu uusi versio viime kuussa.

– CESSDAn sanastopalvelussa luodaan, ylläpidetään ja käännetään monikansalliseen käyttöön tarkoitettuja sanastoja. Monet sanastoista on luotu DDI Allianssin tutkimusaineistojen kansainvälisen kuvailustandardin osaksi, ja osallistun sen sanastoryhmän työhön itsekin. CESSDAn jäsenorganisaatiot kääntävät näitä omille kansallisille kielilleen.

– Näiden lisäksi osallistun kahteen EU-projektiin: TRIPLE (Transforming Research through Innovative Practices for Linked Interdisciplinary Exploration)- ja SSHOC-projekteihin. Molemmissa on samoja elementtejä kuin CESSDA-hankkeissa, mutta nämä koskevat useampaa eurooppalaista tutkimusinfrastruktuuria ja tieteenalaa, kuten kielitieteitä ja humanistisia tieteitä. Kummassakin projektissa olen yhden työpaketin jäsenenä, useimmiten liittyen sanastoihin, niiden hyödyntämiseen tai laajoihin aineistoluetteloihin. TRIPLEssä kiinnostaa erityisesti nähdä, missä määrin algoritmeilla onnistutaan rikastuttamaan eri maista ja eri kielillä tulevaa metadataa.

Mikä hanketyössä on antoisinta?

Mari: Hanketyössä oppii paljon uutta eikä siinä ole kahta samanlaista päivää. Se avaa näköaloja Eurooppaan ja muualle maailmaan ja tarjoaa tilaisuuden nähdä, mitä muualla tehdään ja miten. Hankkeiden kautta voimme myös vaikuttaa siihen, että Suomen avoimen tieteen hyviä käytäntöjä omaksuttaisiin kansainvälisesti. On myös antoisaa olla osaltani vaikuttamassa alan kehitykseen ja rakentamassa CESSDAa ja sen palveluita yhteiskuntatieteilijöille.

Taina: Olen viihtynyt toimiessani ja verkostoituessani eri maista tulevien ihmisten kanssa. On mielekästä tehdä työtä, jossa voi kerrankin hyödyntää kaikkia asiantuntemusalueitaan. Olen taustaltani sekä informaatikko että kielenkääntäjä, joten metadatan harmonisointi ylikielirajojen ja datan löydettävyys kiinnostavat minua aina. Vuosikausien kieliharrastuksestani on ollut yllättävän paljon iloa, koska huomasin voivani tutkailla sanastoja tai aineistokuvailuja kahdeksalla eri kielellä ja pysyä suunnilleen kärryillä siitä, onko siellä vääriä tietoja väärässä paikassa jne. Taidan olla kansainvälisessä työskentelyssä kuin kala vedessä.

– Antoisaa on huomata, että on pystynyt organisoimaan asioita niin, että tavoitteet saavutetaan ja maaliin päästään, vaikka olisi tullut kuinka monta yllättävää mutkaa matkan varrella. Koko ajan saa myös oppia uutta eikä tylsää päivää ole.

Entä mikä on haastavinta?

Mari: Haastavaa on se, että kansainvälisessä hanketyössä tehdään enimmäkseen virtuaalisesti tiimityötä eri taustoista tulevien ihmisten kanssa. Se vaatii erilaisten näkökulmien, tieteenalakäytäntöjen ja ihmisten työtapojen huomioon ottamista ja yhteensovittamista. Monesti tapaaminen ja tutustuminen edes kerran kasvokkain helpottaa yhteistyötä.

Taina: Kun kehitetään kansainvälisiä palveluja, tavoitteesta ollaan usein yksimielisiä mutta matkan varrella joudutaan neuvottelemaan siitä, miten tavoitteisiin parhaiten päästään. Data-arkistot ovat keskenään hyvin erilaisia: osa hyvin resursoituja ja osa vähemmän, osa toiminut vuosikymmeniä, osa on toiminnan alkutaipaleella. Tämä asettaa omat haasteensa esim. metadatan harmonisoinnissa.

– Käyttäjien edustajien ja IT-puolen on myös hyvä jatkuvasti keskustella siitä, paljonko kukin käyttäjien toive vaatii koodauspuolella. Joskus haluttu toiminnallisuus on helposti toteutettavissa ja joskus se vaatii runsaasti työtä. Jälkimmäisessä tapauksessa käyttäjien edustajien on pohdittava, onko se vaivan arvoista. Tärkeintä olisi tunnistaa ja jättää pois paljon IT-työtä vaativat vähemmän tärkeät tavoitteet, jotta voidaan keskittyä olennaisempiin.

– Sisältövastaava on tietyissä asioissa vahtikoira, joka tarkkailee mm. metadatan laatua ja yhteensopivuutta CESSDAn aineistoluettelon ja sanastojen vaatimusten kanssa. Tehtävässä täytyy neuvotella eri maissa sijaitsevien organisaatioiden kanssa heidän metadatansa laadusta ja yhteensopivuudesta sekä hoputtaa esim. sanastojen kääntäjiä tekemään oma kieliversionsa ajoissa. Ystävällisistä reaktioista päätellen ratkaisuja etsivää vahtikoiratoimintaani ei kuitenkaan ole koettu ikäväksi.

Kuinka koronavuoden poikkeusolot ovat vaikuttaneet hanketyöskentelyyn?

Mari: Ehdin onneksi tavata suurimman osan tämänhetkisten hankkeiden yhteistyökumppaneista ennen poikkeusolojen alkua, joten yhteistyö sujuu hyvin myös virtuaalisesti. Kasvokkaisten tapaamisten puuttuessa vapaamuotoinen ideointi on kuitenkin hankalampaa. Kasvokkaisissa kokouksissa epävirallisella sosiaalisella kanssakäymisellä on suuri merkitys - työtä tehdään ihmisten kanssa ja välillä on hyvä jutella heidän kanssaan muustakin kuin työasioista!

Taina: Normaalioloissakin kansainväliset projektit tarkoittavat sähköposteja ja videokonferensseja, joten siihen koronavuosi ei ole tuonut muutosta. Zoom oli kovassa käytössä jo aiemmin. Esimerkiksi aineistoluettelon uuden version teknisen puolen tekijät olivat Iso-Britanniassa ja Norjassa, sanastotyökalun koodari puolestaan Saksassa.

– Ainoa mikä on jäänyt pois, ovat kasvokkaiset tapaamiset ja konferenssit. Niitä kaipaa ja olisi hyvä välillä olla, vaikka en lentokentillä notkumisesta ja muusta matkustamisen aikasyöpöistä pidä. Verkostoituminen on paljon helpompaa, kun ihmiset on tavannut kasvotusten. Monet asiat saa helpommin ja nopeammin selvitettyä paikan päällä ja tauoilla. Jos projektissa on paljon ihmisiä, joita on aina tavannut vain etänä, on toiminnan sujuvuudessa ja verkostoitumisessa eroa verrattuna siihen, että ryhmä olisi ainakin kerran tavannut kasvotusten.

– Etätyön huonoin puoli on työpäivien venyminen, koska tekemistä tuntuu aina riittävän loputtomiin.

Lisätietoa:

» Tietoarkiston hankesivut
» Kehittämispäällikkö Mari Kleemola
» Erityisasiantuntija Taina Jääskeläinen

Henri Ala-Lahti
tietoasiantuntija
etunimi.sukunimi [at] tuni.fi

9. helmikuuta 2021

Love Data -viikko: Rakastamme tutkimusdataa joka viikko!

Nyt vietettävää Love Data -viikkoa voi sanoa jo perinteeksi, kun sitä on useamman vuoden ajan järjestetty ympäri maailmaa. Viikon tarkoituksena on muun muassa muistuttaa tutkimusdatan merkityksestä ja datanhallinnan tärkeydestä. Tietoarkisto on osallistunut datarakkauden ilosanoman levitykseen jo silloin, kun tapahtuman nimi oli vielä Love Your Data. Onhan leipälajimme data tai tutkimusaineistot, kuten me Tietoarkistossa useimmiten sanomme, vaikka määritelmällisesti termeillä onkin eroa.

Love Data -viikon kunniaksi ajattelin palata vanhaan, eli Love Your Dataan. Me Tietoarkistossa nimittäin rakastamme ja vaalimme muiden tutkimusaineistoja eli we love your data. Rakastamme ympäri vuoden, emme vain helmikuussa. Koronapandemian leimaama vuosi 2020 osoitti, että moni muukin on löytänyt toisten keräämän datan äärelle. Viime vuodesta tuli Tietoarkiston Ailan käyttäjämäärien perusteella aineistojen jatkokäytön huippuvuosi. Tänä vuonna kasvu on jatkunut kiivaana, ja aineistoja ladattiinkin tammikuussa selvästi enemmän kuin viime vuonna samaan aikaan. Voidaan sanoa myös, että they love your data!

Koulutusta, tapahtumia ja verkkoviestintää pitkin vuotta

Tällä viikolla, mutta myös pitkin vuotta 2021, nostamme esiin erilaisia tutkimusaineistoja ja tutkimusaineistojen hallinnan tukea meillä ja muualla. Tietoarkisto julkaisee lyhyehköjä videoita tutkimusaineistojen käsittelyn ja hallinnan tueksi, koska pahin tallenteiden saavutettavuuden este, suomenkielisen automaattitekstityksen puute, on ratkaistu. Tietoarkiston näkökulma on tietenkin se, että aineistot kerätään ja käsitellään tutkimushankkeiden aikana niin, että ne saadaan lakien puitteissa tallentaa jatkokäyttöä varten ja pitkäaikaissaatavuus voidaan varmistaa. Tätä koskeva ohjeistus on jo tekstimuotoisena Tietoarkiston Aineistonhallinnan käsikirjassa.

Suunnitteilla on myös verkkotapahtumia. Koronatilanteen salliessa webinaarit muuttuvat syyskaudella kasvokkaisiksi kohtaamisiksi. Onneksi meillä on jo pitkä kokemus toiminnasta erilaisten etäkokoussovellusten kanssa, ja voimme joustavasti vaihtaa fyysisistä tapahtumista verkkoon. Toiseen suuntaan se onkin hankalampaa. Ensimmäisenä, runsaan kuukauden päästä, ohjelmassa on suomenkielinen webinaari Tietoarkisto ja CESSDAn palvelut. Siinä asiantuntijamme esittelevät CESSDAn aineistoluettelon uusia toimintoja ja sanastopalvelua sekä metadatatyötämme. Syyskuulle suunnittelemme perinteiseen tapaan Tietoarkistoseminaaria Ailan nimipäivänä. Teemaa ja sisältöä kehitellään kevään kuluessa.

Tapahtumien lisäksi on luvassa erilaisia verkkojulkaisuja, artikkeleja, blogeja ja herättelyä sosiaalisessa mediassa. Aiheina ovat muun muassa kestävän kehityksen tutkimukseen soveltuvat aineistot Tietoarkistossa ja Tietoarkiston strategiatyö, jota viime vuoden aikana teimme yhdessä valtakunnallisen neuvottelukuntamme kanssa. Teemasivujen kattavuutta kestävän kehityksen näkökulmasta on juuri parannettu uudella teemasivulla kuluttamisen, innovaatioiden ja teollisuuden tutkimiseen soveltuvista aineistoista. Kaikkiaan eriaiheisia teemasivuja on 26.

Tällä viikolla (ja tulevillakin viikoilla) toivon, että te tutkimusaineistojen hallitsijat uskotte oman aineistonne arvoon ja olette valmiita julkaisemaan sen tiedeyhteisölle samalla ylpeydellä kuin muutkin tutkimustuotoksenne. Love Your Data!

Lisätietoa:

» Love Data Week 2021 - International Events
» Aineistoja teemoittain
» Aineistonhallinnan käsikirja

Helena Laaksonen
johtaja
etunimi.sukunimi [at] tuni.fi

5. marraskuuta 2020

Tutkimusdata on pysyvän tunnisteensa ansainnut

Tänään on maailmanlaajuinen digitaalisen pitkäaikaissäilyttämisen päivä. Miksi siis kirjoittaa pysyvistä tunnisteista, PIDeistä? Siksi, että tunnisteen merkitys on keskeinen laadukkaan pitkäaikaissäilytyspalvelun toteuttamisessa. Kuten tutkimusjulkaisu, myös tutkimusdata on laajasti hyödyllinen vain, jos se on löydettävissä ja kuvailtu riittävän yksityiskohtaisesti. Pysyvä tunniste onkin oleellinen osa pyrkimystä löydettävämpään, saavutettavampaan, yhteentoimivampaan ja uudelleenkäytettävämpään – siis FAIRimpaan – dataan. Se edistää myös avointa tiedettä ja tutkimusta.

Jos tutkimus olisi aina ollut digitaalista, PID (Persistent Identifier) olisi varmasti jo tutkimusdatan normaali kumppani, samoin kuin julkaisuille jo pitkään annetut kirjastoluokitukset ja teoksen identifioiva merkkijono. Tunnisteen avulla digitaalinen aineistopaketti on yksiselitteisesti identifioitavissa ja viitattavissa. Pääsääntöisesti oletamme, että data on saatavissa "verkosta". Vielä toistaiseksi datan löytäminen tai tiettyyn dataan viittaaminen vaatii usein nojautumista muuttuviin URL-osoitteisiin tai viittaamista hakutuloksiin tietokannasta.

PID on avain. Se tunnistaa ja avaa laatikon, josta löytyy itse datan ohella sen kuvaus, ja kenties joukko versioita tai tietoja siitä, mitä versiota tai mitä osaa datasta on hyödynnetty. PID yksistään ei tietysti takaa kaikkea tätä. Mutta PIDillä on omistaja, jolla on velvollisuus taata tunnisteen toimivuus, ainutkertaisuus ja pysyvyys - ja siten datan löydettävyys. Siksi pysyvää tunnistetta ei tulisi koskaan saada aineistolle, jonka metatiedosta, saatavuudesta tai säilyttämisestä ei ole huolehdittu.

PID on käypää valuuttaa. Sillä on käyttöarvo ja tunnisteiden hallinta pitää arvoa yllä. Ylläpitäjä, korkeakoulu, kirjasto tai data-arkisto, vastaa siitä, että tunniste resolvoituu oikeaan lähteeseen. Pitkäaikaissäilytyksen kannalta tämä tarkoittaa, että tiedetään, mikä versio ja millä tunnisteella, on milloinkin säilytetty.

PID lisää luotettavuutta. Kaikki pysyvät tunnistejärjestelmät vaativat, että tunnisteita hallinnoidaan aina siitä alkaen, kun tunniste annetaan. Vaikka aineisto myöhemmin syystä tai toisesta hävitettäisiin tai sen saatavuutta rajoitettaisiin, PID johtaa kyselijän edelleen aineiston perustietoihin. Näin pitkä sitoutuminen aineiston ja sen tietojen ylläpitoon ei voi jäädä tutkijan vastuulle, vaan taustalla tulee olla jokin luetettava taho – esimerkiksi data-arkisto. PIDin tulee lisätä luottamusta siihen, että aineisto on luotettavasti säilytetty ja sen saatavuudesta on huolehdittu. PID kertoo, että datastasi välitetään.

PID parantaa yhteentoimivuutta. Nykypäivänä tiedon on liikuttava tietojärjestelmästä toiseen. Kun pysyvä tunniste on dokumentoitu kuvailevaan metadataan koneluettavassa muodossa, haravoituu se erilaisiin yhteysluetteloihin tai julkaisuarkistoihin osana dataviittausta. Siten PID edistää meriitin syntymistä datan tuottajille. Yhtä lailla tutkimusorganisaatiot, julkaisijat tai julkaisutiedon kerääjät voivat hyödyntää tunnistetta dataan kohdistuvien viittausten kokoamiseen. Rahoittajille tunniste tarjoaa mahdollisuuden esimerkiksi automatisoida rahoittamiensa tutkimustuotosten seuraamista.

PIDit Tietoarkistossa

Tietoarkisto antaa kullekin arkistoitavalle datalle pysyvän tunnisteen. Me käytämme URN-tunnisteita. Olemme valinneet käytännöksi, että tunniste muodostetaan aineistolle annettavan aineistonumeron perustalle, joten ihminenkin näkee, mihin aineistoon tunniste viittaa. Tämä helpottaa tunnisteen käsittelyä ja ymmärtämistä esim. tutkimusjulkaisussa, mutta on silti täysin koneluettava. Kukin aineisto saa pysyvän tunnisteensa jo siinä vaiheessa, kun sen arkistointi aloitetaan. Siten viitteen keräämäänsä (tai käyttämäänsä) aineistoon voi liittää julkaisuun jo etukäteen. Aluksi tunniste johtaa tietoon siitä, että kyseinen aineisto on arkistointiprosessissa. Myöhemmin, kun arkistointi on valmistunut ja aineisto on saatavissa, sama viite tulee ohjaamaan dataan tai sen versiohistoriaan.
PID - tunnista, mitä avaat!

Lisätietoa:

» PID linkkinä resolvoituu aineistokuvaukseen Ailassa: urn:nbn:fi:fsd:T-FSD3424
» Näin Tietoarkisto palvelee arkistoinnissa
» World Digital Preservation Day

Tuomas J. Alaterä
IT-palveluasiantuntija
etunimi.sukunimi [at] tuni.fi

21. syyskuuta 2020

ISSP 20 vuotta Suomessa - kurkistus aineistonkeruun toteutukseen

Annika Valaranta
International Social Survey Programme eli ISSP-aineistosarjaa on kerätty Suomessa jo vuodesta 2000 lähtien. Nyt syksyllä kerättävän aineiston teema on ympäristö - sama, jolla 20 vuotta sitten aloitimme. Tämän kunniaksi valotamme hieman, mitä kansainvälisen aineiston keruuprosessi vaatii, jotta kerättävä data on harmonisoitavissa eli yhdistettävissä ja ymmärrettävissä muissa maissa kerättävän datan kanssa.

Tietoarkiston kokenut ISSP-aineistojen käsittelijä Seppo Antikainen jäi eläkkeelle keväällä ja tällä kirjoituksella haluamme myös antaa tunnustusta ja kiittää häntä sarjan eteen tehdystä työstä. Kiitos Seppo!

ISSP-aineiston keruu Suomessa

ISSP:n logo
ISSP-konsortio kerää maailmanlaajuisesti yhteiskuntatieteellistä dataa. Suomessa ISSP-työryhmässä ovat vastaavat tutkijat Harri Melin ja Sami Borg sekä Tietoarkiston ja Tilastokeskuksen kääntämisen, aineistonkäsittelyn ja -keruun asiantuntijat. Tietoarkisto luovuttaa Tilastokeskuksen keräämän ISSP-datan harmonisoinnista vastaavalle Saksan Gesis-arkistolle.

ISSP:ssä tutkittavat aiheet vaihtuvat vuosittain, mutta sama teema toistuu keruissa säännöllisesti, mikä mahdollistaa pitkittäisvertailun. Aiheina ovat olleet muun muassa sosiaaliset verkostot, eriarvoisuus, perhe- ja sukupuoliroolit, työ, uskonto, vapaa-aika ja urheilu sekä ympäristö. Kansainvälinen harmonisoitu data on saatavilla Gesisistä, mutta Suomen kyselyt myös Tietoarkistosta.

ISSP-prosessi alkaa uuden lomakkeen kääntämisellä

Keruuprosessi alkaa joka vuosi vuoden vaihteessa, jolloin Saksasta ISSP-tiimi lähettää osallistuville maille kyselylomakkeen kommentoitavaksi. Sen perusteella muotoutuu lopullinen kyselylomake. Kyselyn kysymykset ovat jaettavissa kolmeen ryhmään: taustamuuttujiin, vanhoihin sisältökysymyksiin ja uusiin kysymyksiin. Kun lopullinen englanninkielinen lomake on valmis, Tietoarkisto kääntää uudet kysymykset ja tarkistaa, pitääkö vanhoja kysymyksiä päivittää ja onko taustamuuttujiin tullut muutoksia. Vahva pääsääntö on, ettei jo aiemmin kysyttyjä kysymyksiä muuteta, sillä uusi kysymyksenasettelu voi estää aiheen pitkittäistarkastelun kokonaan. Kuitenkin pieniä viilauksia on tehty: esimerkiksi ennen käytetty teitittely on muutettu nykyään sinutteluksi.

Kuvituskuva: Karttapallo
Uusien kysymysten kääntäminen suomeksi englanninkielisestä pohjalomakkeesta on tarkkaa työtä, sillä kysymysten tulee olla ymmärrettävissä suomalaisessa kontekstissa. Kun lopulta kansainvälinen data yhdistetään Gesisissä, tulee kysymysten mitata samaa asiaa. Esimerkiksi vuoden 2020 kyselyssä kääntäjät kokivat hankalaksi kääntää lauseen: How willing would you be to accept a reduction in the size of [country's] protected nature areas, in order to open them up for economic development? Suomen kielessä ei ole suoraa vastinetta termille "economic development", joka viittaa monenlaiseen eri taloudelliseen kehitykseen (esim. louhinta, kaavoitus, hakkuut). Lopullisen voiton käännöksessä vei kuitenkin yksinkertainen versio "taloudellinen hyödyntäminen" sujuvan luettavuuden vuoksi. Lopullinen kysymys on Kuinka halukas olisit supistamaan Suomen luonnonsuojelualueiden kokoa, jotta niitä voitaisiin ryhtyä hyödyntämään taloudellisesti?

Datojen kanssa pilkunviilaus on sallittua

Kun Tietoarkisto on keväällä saanut kyseisen vuoden kyselyn käännettyä suomeksi, se lähetetään Tilastokeskukseen, joka tekee lopulliset lomakkeet. ISSP-kyselyyn voi vastata niin verkossa kuin paperisella lomakkeella. Tämä tarkoittaa useaa tarkistusta ennen lopullista Tilastokeskuksen syksyllä tekemää keruuta. Ensin tarkistetaan Tilastokeskuksen suomenkielinen ja käännetty ruotsinkielinen lomake. Sitten tarkistetaan molempien kielten internetkyselyt, joiden pitää vastata täysin paperilomakkeita. Myös tutkittavien informoinnit tulee kääntää ja tarkistaa.

Datojen parissa työskentelyssä tarkkuutta ja tarkistamista ei voi ylikorostaa. Tarkistamisessa kiinnitetään huomiota siihen, että lomakkeissa kysytään kaikki pakolliset kysymykset, kysymysten vastausvaihtoehdot ovat samat ja että niiden määrä vastaa alkuperäistä englanninkielistä kyselylomaketta.

Datan valmistuminen jatkokäyttöön

Tilastokeskus lähettää keruun valmistuttua datan Tietoarkistoon prosessoitavaksi aineistoportaali Ailaa varten. Suomenkielinen data on saatavissa Ailasta usein jo maaliskuussa, siis noin puolen vuoden kuluttua keruusta. Tuore kysely pääsee heti tutkijoiden ja opiskelijoiden tarkasteluun.

Lisäksi Tietoarkisto käsittelee datasta kansainvälisen version lähetettäväksi Gesisille. Käsittely varmistaa aineiston yhdistettävyyden muiden maiden datojen kanssa. Yksityiskohtaiset ohjeet käsittelyyn, kuten miten muuttujat ja selitteet nimetään, tulevat Gesisiltä. Kansainvälinen data eroaa Ailasta ladattavasta aineistosta esimerkiksi muuttujien numeroinnissa. Lisäksi datassa ei saa olla yhtään puuttuvaa tietoa, jolla ei ole selitettä. Luovutettavaan dataan lisätään myös useita uusia muuttujia, kuten muiden maiden vastauksien kanssa yhteensopiva uskontokuntamuuttuja.

Gesisille tulee lähettää myös tarkat tiedot aineistonkeruusta ja siitä, miten muuttujat on koodattu. Pienimmätkin muutokset, kuten yksittäisen sanan yksikkömuotojen muutos monikkoon, kirjataan ylös. Tällä kaikella työllä halutaan varmistaa laadukas kansainvälinen aineistosarja, joka kestää tarkastelua vielä vuosikymmenien ja vuosisatojen päästä.

Tyylitelty maailmankartta jossa on pistein merkitty, mitä maat ovat mukana ISSP-tutkimuksessa.

ISSP:n jäseninä on tällä hetkellä 42 maata, joista 25 on Euroopasta. Mukana ovat maailmanpoliittisesti merkittävät suuret valtiot kuten Yhdysvallat, Venäjä, Kiina ja Intia.

Lisätietoa:

» Tietoarkiston ISSP-sivut
» International Social Survey Programme -tutkimusohjelma
» Gesisin ISSP-sivut
» ISSP-aineistot Ailassa

Annika Valaranta
tietopalveluasiantuntija
etunimi.sukunimi [at] tuni.fi

15. kesäkuuta 2020

Tietoarkisto mahdollistamassa kansainvälistä vertailevaa tutkimusta

Suuri osa Tietoarkiston tekemästä työstä on kansainvälistä yhteistyötä, johon kuuluu myös kaksi merkittävää kansainvälistä aineistonkeruuohjelmaa: International Social Survey Programme (ISSP) ja European Values Survey (EVS). Tietoarkisto on mukana näiden kansainvälisten aineistojen keruun rahoittamisessa, suunnittelussa, käännöstyössä sekä suomalaisen datan käsittelyssä kansainvälisen aineiston vaatimusten mukaiseksi. Tietoarkisto myös arkistoi Suomen maakohtaisen aineiston ISSP:n, EVS:n ja World Values Surveyn (WVS) keruista. Saksalainen sisararkistomme GESIS arkistoi aineistosarjojen kansainväliset aineistot.

Kansainvälinen vertailudata suosittua

Kansainväliset vertailuaineistot kuten ISSP ja EVS kuuluvat Tietoarkiston suosituimpiin aineistoihin, ja palveluportaali Ailassa on tiedot lukuisista julkaisuista, joissa aineistoja käytetään. Aiemmin Ailaan on kuitenkin kerätty julkaisutiedot vain kotimaiseen dataan pohjautuvista julkaisuista. Tänä kesänä käymme läpi kansainvälisiä yhdistelmäaineistoja hyödyntäviä julkaisuja, joissa myös Suomen aineistoa on analysoitu, ja lisäämme niiden tietoja Ailan aineistokuvailuihin.

Monissa maissa ylikansalliset vertailututkimusaineistot ovat muodostuneet tärkeäksi ja suosituksi tutkimusresurssiksi. Vertailuaineistojen ja datan globaalin löydettävyyden kasvava tarve näkyy myös esimerkiksi Euroopan yhteisiä avoimen tieteen pilvipalveluita kehittävässä EOSC-hankkeessa.

Suomi esillä kansainvälisessä tutkimuksessa

Vertailututkimusaineistojen kerääminen on kuitenkin työlästä, sillä yhteensovittamisessa pitää ottaa huomioon eri maiden ja kulttuurien erilaiset käytännöt ja kielet. Yhteistyössä suomalaisten yhteiskuntatieteilijöiden ja tutkimusorganisaatioiden kanssa Tietoarkisto on mahdollistanut viimeisen liki kahdenkymmenen vuoden ajan sen, että Suomi on mukana laajoissa ja tunnetuissa kansainvälisissä aineistosarjoissa.

Laajoihin vertailuaineistojen keruihin osallistuminen mahdollistaa sen, että kotimaiset ilmiöt asettuvat oikeisiin suhteisiinsa ja suomalainen yhteiskunta ja kulttuuri paikalleen muiden joukkoon. Maailmanlaajuisesti tunnettuja tutkimusohjelmia kuten ISSP:tä ja EVS:ää pidetään myös luotettavina sekä hyvin dokumentoituina ja suunniteltuina. Kymmeniätuhansia havaintoyksiköitä sisältäviä kansainvälisiä aineistoja käytetäänkin ahkerasti, sillä ne tarjoavat loputtoman määrän tutkimusasetelmia ja tilastollisia lähestymistapoja.

ISSP- ja WVS/EVS-aineistot ovat tärkeitä myös kotimaisessa yhteiskuntatieteellisessä tutkimuksessa, mutta Suomen datan merkitystä kansainvälisessä kontekstissa ei saa unohtaa. Tietoarkisto seuraa esimerkiksi ISSP:n osalta suomalaisten aineistojen latausten määriä Ailasta, mutta nämä määrät ovat pieniä verrattuna siihen, kuinka paljon saksalaisesta GESISistä ladataan kansainvälisiä yhdistelmäaineistoja. GESISiltä saatujen tilastojen mukaan Suomen datan sisältäviä ISSP-yhdistelmäaineistoja on ladattu vuosina 2016-2019 lähes 30 000 kertaa.

Urakkaa riittää

Kansainvälisten vertailuaineistojen avulla tehdään tutkimusta siis huimia määriä, ja kaikkia Suomen dataa hyödyntäviä julkaisuja ei todennäköisesti koskaan ehditä kirjaamaan Ailaan: pelkästään ISSP:n julkaisuluettelo sisältää yli 9 000 julkaisua, joista suuressa osassa Suomen aineistoja on mukana mutta suuressa osassa ei. Julkaisutietojen kerääminen on työlästä, sillä toistaiseksi niiden koneelliseen haravointiin ei ole olemassa välineitä; kirjattavien julkaisujen selvittäminen vaatii monissa tapauksissa siis julkaisun manuaalista läpikäyntiä.

Tähän mennessä olemme keränneet runsaat kaksisataa viitetietoa Suomen aineistoja hyödyntävistä kansainvälisistä julkaisuista, kuten tutkimusartikkeleista ja monografioista. Työ on siis alkutekijöissään, mutta jo tässä vaiheessa on selvää, että Suomi on näkyvästi vertailevan yhteiskuntatutkimuksen maailmankartalla.

Lisätietoa:

» ISSP:n esittely Tietoarkiston sivuilla
» EVS:n/WVS:n esittely Tietoarkiston sivuilla
» International Social Survey Programme -tutkimusohjelman julkaisuluettelo
» European Values Survey -tutkimusohjelman julkaisuluettelo
» GESIS - Leibniz-Institut für Sozialwissenschaften
» Ailan julkaisuhaku

Niko Koski
tietoasiantuntija
etunimi.sukunimi [at] tuni.fi

Tämä blogikirjoitus on luettavissa myös englanniksi:
FSD Enabling Cross-National Comparative Research.

FSD Enabling Cross-National Comparative Research

A lot of the work done at FSD is related to our international collaboration, which also includes two significant international survey programmes: International Social Survey Programme (ISSP) and European Values Survey (EVS). FSD is involved in the planning and funding of data collection as well as questionnaire translation and processing the data in line with the international requirements. FSD also archives the Finnish data from ISSP, EVS and World Values Survey (WVS). Our German colleagues at GESIS archive the complete international datasets from these programmes.

Comparative data growing in popularity

At FSD, international comparative datasets like ISSP and EVS are among Aila Data Service's most frequently downloaded, and information on several publications utilising data from these programmes are available on Aila. Until now, however, we have only collected information about publications based on the Finnish data, leaving out comparative research done on the complete datasets. This summer, we will go through international publications that have used the international datasets from GESIS with Finnish data included and add their information on Aila Data Service.

In many countries, cross-national comparative research data have become a significant resource for academic research. The growing need for globally discoverable comparative data is also one of the driving factors behind the European Open Science Cloud (EOSC) initiative which aims to build common European open science services.

Finland represented in international research

However, collecting comparative international data is rather labour-intensive. Harmonising data collection instruments and processing the data require consideration of the different practices and languages of different countries and cultures. For two decades, FSD has enabled Finnish participation in broad, well-known international survey programmes in collaboration with Finnish social scientists and research organisations.

Involvement in extensive comparative surveys facilitates researching Finnish society and culture in relation to other countries, enabling the measurement of domestic social phenomena to those abroad. Globally known survey programmes like ISSP and EVS are considered trustworthy, thoroughly documented and well planned. The international datasets covering tens of thousands of individual observations are popular, because they offer a limitless number of research designs and statistical approaches.

Thus, the impact of Finnish data reaches far beyond Finnish borders, although the Finnish ISSP and EVS/WVS datasets are also important in domestic social science research. FSD monitors the number of downloads of ISSP, EVS and WVS data from Aila, but these numbers are small compared to the number of downloads of the complete international datasets from GESIS. For example, the complete ISSP datasets with Finnish data included were downloaded approximately 30,000 times in 2016-2019, according to statistics received from GESIS.

Much work to be done

All in all, monumental amounts of research is done using international comparative datasets, and we will most likely never be able to identify all international publications using Finnish ISSP/EVS/WVS data: for instance, ISSP's official list of publications includes more than 9,000 publications, of which a large part utilise Finnish data but a large part also do not. Charting which publications use Finnish data is an arduous task: publication information currently cannot be machine-harvested, and each publication has to be inspected manually.

Thus far we have collected information on approximately 200 publications such as research articles or monographs that utilise Finnish ISSP, EVS or WVS data. In other words, the work is only beginning. Needless to say, however, that Finland's visibility is remarkable on the world map of comparative social science.

Further information:

» International Social Survey Programme publications
» European Values Survey publications
» ISSP datasets on Aila Data Service
» GESIS - Leibniz-Institut für Sozialwissenschaften
» Aila Data Service, publications search

Niko Koski
Information Specialist
firstname.surname[at] tuni.fi

This blog entry is available also in Finnish:
Tietoarkisto mahdollistamassa kansainvälistä vertailevaa tutkimusta.

9. huhtikuuta 2020

Tietoarkisto ja aineistonhallinta koronakriisin aikaan

Tietoarkistossa siirryttiin nopeasti etätyöskentelyyn maaliskuun puolivälissä. Onneksi etätyön mahdollistavia tietoteknisiä ratkaisuja oli otettu käyttöön jo aiemmin ja Tietoarkistolle räätälöityä etäyhteyttä valmisteltu Tietoarkiston teknisten palvelujen ja Tampereen yliopiston tietohallinnon yhteistyöllä. Yhteys saatiin käyttöön nopeutetulla aikataululla suurelle osalle tietoarkistolaisista heti ensimmäisen etätyöviikon aikana.

Arki jatkuu ja kokoukset rullaavat

Lähes kaikki tietoarkistolaiset pystyvät nyt hoitamaan tehtävänsä normaalisti sosiaalisesta etäisyydestä huolimatta. Sovellus- ja järjestelmäkehitys ja -ylläpito jatkuvat. Tietoarkiston aineistonkäsittelijät ovat julkaisseet etänä useita uusia aineistoja. Asiakkaat ovat myös luovuttaneet aineistoja ja ladanneet aineistoja Ailassa, mistä voimme päätellä, että etätyö sujuu mallikkaasti myös muissa yliopistoissa ja tutkimusorganisaatioissa.

Itse olen kokoustanut Teamsillä, Zoomilla ja GoToMeetingillä. Kokouksissa hetkellisiä ongelmia on aiheuttanut mobiilidatayhteyteni pätkiminen. Muutoin etäkokoukset ovat ajankäytön näkökulmasta kasvokkain järjestettäviä tehokkaampia. Uupumaan jää kuitenkin epävirallisempi kuulumisten vaihtaminen. Kansainvälisessä ja kotimaisessakin yhteistyössä tärkeitä tietoja ja vertaistukea välittyy epävirallisissa käytävä- ja lounaskeskusteluissa, minkä vuoksi kaikkia kokouksia ei kannata jatkossakaan järjestää virtuaalisina. Jotakin tästä nyt opittavasta työtavasta toivoisi jäävän käyttöön myös koronakriisin jälkeiseen aikaan.

Akuutisti tarvittava avoin data ei vähennä pitkäaikaissaatavuuden merkitystä

Koronakriisin vuoksi monet ovat innostuneet keräämään tutkimusaineistoja. Myös muun kuin lääke- ja terveystieteellisen tiedon tarve on polttava. Tietoarkiston tekstiaineiston keräämiseen tarkoitettua Pennaa on suunniteltu jo muutamien aineistonkeruiden välineeksi. Toivon, että saamme koronapandemian vaikutuksia käsitteleviä keruita käyntiin vielä lisää.

On tietenkin tärkeätä saada aineistot mahdollisimman nopeasti mahdollisimman laajan tutkijajoukon käyttöön, jotta tutkimustiedosta on hyötyä ajankohtaiseen tiedontarpeeseen. Toivon kuitenkin, että tässäkään tilanteessa ei unohdeta aineistojen pitkäaikaissaatavuuden merkitystä. Ei tarvita epidemiologin koulutusta sen ymmärtämiseen, että koronakriisi ei ole viimeinen laatuaan. Nyt kerättävien aineistojen löydettävyys, saatavuus ja käytettävyys ovat ratkaisevia, jotta tutkijoilla on tulevaisuudessa nopeasti käytettävissään tietoa ihmisten kokemuksista ja reagoinnista vastaavissa kriisitilanteissa. Arkistoituna tutkimusdata tarjoaa myös vertailukohdan tulevaisuudessa, kun tutkijat keräävät uutta aineistoa.

CTS-sertifikaatti on luotettavan repositorion merkki

Muistattehan nytkin aineistoa kerätessänne ja tallennuspaikkaa valitessanne, että kaikki ad hoc -repositoriot, tai jo pitempään toiminnassa olleetkaan repositoriot, eivät takaa aineiston pitkäaikaissaatavuutta eivätkä anna tukea julkaisemisen tietoturvakysymyksissä. Suomessa CTS-sertifioituja, luotettaviksi arvioituja, repositorioita on kaksi: Tietoarkisto ja Kielipankki.

Jos tunnette houkutusta tallentaa ihmistieteellisen datanne kansainväliseen repositorioon, tarkistakaa käyttöehdot ja mahdolliset vastuuvapauslausekkeet ja muistakaa, että me kotimaiset CTS-sertifikaatin haltijat olemme kansainvälisiä toimijoita.

Lisätietoa:

» Aila
» Penna
» Aineistonhallinnan käsikirja
» CoreTrustSeal (CTS) -sertifikaatti
» Koronavirus ja Tietoarkiston toiminta poikkeusoloissa
» Uusi palvelinympäristö parantaa toimintavarmuutta ja säästää energiaa

Helena Laaksonen
johtaja
etunimi.sukunimi [at] tuni.fi

20. toukokuuta 2019

Anonymisointi luontevaksi osaksi tutkimusprosessia

Aineistonhallinta vaatii tutkijalta entistä enemmän osaamista. Tutkijan tulisi opiskella muuttuneet tietosuojakäytänteet ja toisaalta pitäisi pystyä vastaamaan myös datan avoimuuden haasteeseen. Usein aineiston arkistoiminen jatkokäyttöön on mahdollista vain anonyyminä. Anonymisoinnin osaaminen ja resursointi nousevat tässä vaiheessa keskeiseen asemaan. Tutkijoiden näkökulmasta lisävaatimukset eivät ole aina mieluisia, sillä usein anonymisointiin ei ole varattu aikaa ja toisaalta ei ole myöskään tietoa, miten aineisto saatetaan anonyymiksi. Jonkin pitää muuttua, mutta miten?

Mieti anonymisointia jo tutkimusprosessin alussa

Uudet vaatimukset otetaan haltuun muuttamalla käsitystä anonymisoinnista ja kasvattamalla anonymisoinnin osaamista. Tästä lähtien tutkimusprojekteissa tulee jo alkuvaiheessa resursoida anonymisoinnin suunnitteluun ja toteuttamiseen. Käsitys siitä, että anonymisointi on jotain, jota tehdään vain aineistonkeruuvaiheessa poistamalla suorat tunnisteet tai tutkimusprosessin loppuvaiheessa ennen arkistointia, tulisi heittää romukoppaan.

Ensinnäkään anonymisointi ei ole vain suorien tunnisteiden poistamista, vaan vaatii laajemman aineiston sisällön tarkastelun ja tietojen suhteuttamisen ulkopuolelta saataviin tietoihin. Anonymisoinnissa pyritään ymmärtämään, minkä tiedon poistaminen on tarpeellista, ja miten tietojen poistaminen vaikuttaa aineiston käytettävyyteen. Toiseksi anonymisointia tulee miettiä jo tutkimusprosessin alussa, sillä henkilötiedot tulee kerätä tietosuoja-asetuksen minimoinnin periaatteen mukaan eli keräämällä vain tutkimuksen kannalta tarpeellisia tietoja. Henkilötietojen keruun huolellisella suunnittelulla voi vähentää oleellisesti anonymisointiin myöhemmin kuluvaa aikaa.

Miten kerättäviä tietoja voi minimoida?

Määrällisissä aineistonkeruissa anonymisointia vaativien tietojen keruuta pystyy minimoimaan tehokkaasti välttämällä avokysymyksiä, joiden sisältöä tutkija ei voi kontrolloida. Kannattaa välttää myös kysymyksiä, joiden perusteella vastaajasta paljastuu kohdejoukkoon nähden harvinaisia tietoja. Tietoja suositellaan kerättäväksi valmiiksi luokiteltuna, niin että kysytään esimerkiksi yksittäisen harrastuksen sijaan harrastustyyppiä. Kirjoitettavan avovastauksen "pelaan jalkapalloa Äänekosken Huimassa" sijaan vastaaja voi valita esimerkiksi luokitellun arvon "palloilulajit", eikä tutkijan tarvitse anonymisoida paikkakuntaa ja seuraa. Erityisesti taustatietojen kysyminen luokiteltuna ehkäisee oleellisesti myöhäisempää anonymisointitarvetta niin kvalitatiivisissa kuin kvantitatiivisissa aineistoissa.

Laadullisissa aineistoissa sisällön etukäteen rajoittaminen on hankalampaa, mutta sitä voi helpottaa muutaman hyödyllisen vinkin avulla. Esimerkiksi haastatteluissa ja kirjoitusaineistoissa haastateltavien taustatiedot kannattaa kerätä strukturoituna, henkilöiden vapaamuotoisten esittelyjen sijaan. Haastattelun aluksi haastattelija voi esimerkiksi pyytää iän, ammatin ja lasten lukumäärän luokiteltuna. Haastateltavia voi myös muistuttaa aluksi ystävällisesti, jos haastattelun luonne antaa siihen mahdollisuuden, että he eivät kertoisi ihmisten oikeita nimiä tai muita tarkkoja tietoja. Tutkija voi myös välttää liian yksityiskohtaista tietoa tuottavien kysymysten esittämisen.

Yleisimmät ongelmat anonymisoinnissa

Koska anonymisointiin ei ole valmiina kaikkiin aineistoihin sopivia ohjeistuksia, se voidaan kokea haasteellisena. Usein ongelmana on hahmottaa, mitä tietoja tulee anonymisoida ja mitä tietoja voidaan jättää. Tutkija saattaa myös ajatella, ettei sensitiivistä aineistoa voi saattaa anonyymiksi. Anonymisoinnin jälkeen tutkijan mieleen voi hiipiä myös pelko siitä, onko aineistoa anonymisoitu tarpeeksi.

Ensinnäkin tulee muistaa, että aineiston sensitiivisyys ei ole lähtökohtaisesti este aineiston anonymisoinnille ja jakamiselle. Sensitiivisen aineiston anonymisointi voidaan suunnitella samalla tavoin kuin ei-sensitiivisiä tietoja sisältävän aineiston. Merkityksellisintä on henkilöistä saatavien taustatietojen ja muiden aineiston sisältämien tietojen karkeistaminen tai poisto tasolle, josta yksittäisiä henkilöitä ei pysty tunnistamaan. Sensitiivisen aineiston anonymisointi voi kuitenkin olla haasteellista, sillä aineiston luonteen vuoksi rajoitettavia tietoja voi olla paljon.

Anonymisointitarpeen hahmottamisen helpottamiseen tarvitaan ohjeistusta ja tarve konkreettisille anonymisointiohjeille on suuri. Ennen anonymisoinnin ohjeistus keskittyi usein anonymisoinnin menetelmien, kuten karkeistuksen ja luokitteluiden, esittämiseen, ei anonymisointipäätösten tekemisestä ohjeistamiseen. Ohjeistuksen tarpeeseen vastatakseen Tietoarkisto on päivittänyt anonymisoinnin ohjeistuksiaan viimeksi viime kuussa. Ohjeistuksiin lisättiin erityisesti tukea anonymisoinnin suunnitteluun. Ohjeista löytyy nyt myös havainnollistavia esimerkkejä ja mallipohjia anonymisointisuunnitelman tekoon.

Anonymisoinnin tarpeen hahmottaminen

Kun haluaa anonymisoida oman tutkimusaineistonsa, sille kannattaa tehdä anonymisointisuunnitelma, josta käy ilmi tunnisteellisuuden kannalta tärkeimmät aineiston tiedot ja tehdyt anonymisointipäätökset ja -toimet. Anonymisoitavien tietojen hahmottamiseen auttaa seuraavien tärkeimpien asioiden muistaminen ja tarkastelu:

  • Suorat tunnisteet poistetaan aina!
  • Keitä ja mitä tutkit? Henkilöiden tunnistettavuus riippuu paljon tavoitellun kohdejoukon määrästä ja tutkittavasta ilmiöstä. Mitä pienempi kohdejoukko ja mitä enemmän heistä on saatavilla tietoa, sitä vähemmän yksityiskohtaista tietoa henkilöistä voidaan jättää aineistoon.
  • Anonymisoinnissa pyritään eroon harvinaisista tiedoista, joiden perusteella yksittäinen henkilö tai rypäs on tunnistettavissa. Anonymisoitavia tietoja pohditaan aina suhteessa tutkimuksen perusjoukkoon. Tieto on harvinainen vain, jos ominaisuus on harvinainen kohdejoukossa. Pienet jakaumat eivät ole näin yksiselitteisesti harvinaista tietoa. Harvinaistakaan tietoa ei tarvitse anonymisoida, jos tietoa henkilöstä ei voida saada selville.
  • Pohdi, voiko henkilö olla tunnistettavissa yhdistämällä aineiston tietoja toisiinsa. Pohdi myös, mitä tietoja tutkittavista voi olla saatavilla ulkoisista lähteistä, kuten sosiaalisesta mediasta, ja voiko tietoja yhdistää datan sisältämiin tietoihin. Esimerkiksi LinkedInissä on useamman suomalaisen koulutus- ja työhistoria julkisesti nähtävillä.
  • Sensitiivisten tietojen anonymisointi on tarpeellista, mikäli niiden perusteella voi tunnistaa tai päätellä yksittäisen henkilön tai henkilöitä. Jos sensitiivisten asiasisältöjen tutkiminen on tutkimuksen kannalta keskeistä, tietoja ei tietenkään poisteta, vaan aineisto pyritään tekemään anonyymiksi muita henkilöihin viittaavia tietoja poistamalla.
  • Jos aineisto vaatii anonymisointia, se voidaan toteuttaa monin eri tavoin. Pyri poistamaan tietoja, jotka ovat vähemmän tärkeitä tutkimusilmiön kannalta ja säilyttämään tärkeimmät taustatiedot. Esimerkiksi, jos kuntatasoinen muuttuja aluetietona on tutkimuksen kannalta merkityksellinen, anonymisointia voi tehdä esimerkiksi vastaajan perhe- tai tulotietoihin.

Lisätietoa ja tarkemmat ohjeet löydät Tietoarkiston aineistonhallinnan käsikirjasta.

Anonymisoinnin kartoittamisen jälkeen voi jopa olla että anonymisointia ei välttämättä tarvitsekaan tehdä. Tällainen tilanne voi olla esimerkiksi väestötutkimuksissa, joissa aluemuuttuja on kerätty vain maakunnan tasolla ja muiden tietojen perusteella henkilöt eivät ole yksilöitävissä tai liitettävissä harvinaisiin ryhmiin. Anonymisointisuunnitelman tekeminen on siis suositeltavaa, jotta tutkimusprosessin aikana aineistoa tulee tarkasteltua kerran yksinomaan tunnisteellisuuden näkökulmasta. Lisäksi suunnitelma toimii hyvänä dokumentaationa aineistoille tunnisteellisuussyistä tehdyistä muutoksista, mikäli aineisto luovutetaan jatkokäyttöön.

Et ole anonymisointipulmiesi kanssa yksin

Anonymisoinnin riittävyys on yleinen tutkijoiden huoli, ja se on hyvin ymmärrettävää. Tulee kuitenkin muistaa, että anonyymiksi voidaan määritellä aineisto, josta ei kohtuullisen todennäköisesti käytettävissä olevin keinoin voi tunnistaa tai päätellä henkilöitä. On jo paljon, että aineiston anonymiteettiä ja henkilöiden paljastumisriskiä on pohdittu ja se on kirjattu anonymisointisuunnitelmaan. Lisäksi on hyvä muistaa, että aineistolle voidaan tehdä lisäanonymisointia myöhemminkin. Aineistolle tulee tehdä säännöllisesti jäännösriskin arviointi, jossa tarkastellaan anonymiteettiä uudelleen. Se on tarpeellista tiedon lisääntymisen ja tekniikan kehittymisen vuoksi.

Tavoitteet anonymisoinnin käsitysten muuttamisesta ja osaamisen levittämisestä ovat alkuvaiheessa. Toivomme, että anonymisointi nähdään mahdollisuutena lisätä tieteen avoimuutta ja luotettavuutta. Asiasta tarvitaan myös keskustelua ja näkemyksiä. Otamme niitä mielellämme vastaan täällä Tietoarkistossa!

Annika Sallinen
tietopalveluasiantuntija
etunimi.sukunimi [at] tuni.fi