Näytetään tekstit, joissa on tunniste aineistonkäsittely. Näytä kaikki tekstit
Näytetään tekstit, joissa on tunniste aineistonkäsittely. Näytä kaikki tekstit

21. syyskuuta 2020

ISSP 20 vuotta Suomessa - kurkistus aineistonkeruun toteutukseen

Annika Valaranta
International Social Survey Programme eli ISSP-aineistosarjaa on kerätty Suomessa jo vuodesta 2000 lähtien. Nyt syksyllä kerättävän aineiston teema on ympäristö - sama, jolla 20 vuotta sitten aloitimme. Tämän kunniaksi valotamme hieman, mitä kansainvälisen aineiston keruuprosessi vaatii, jotta kerättävä data on harmonisoitavissa eli yhdistettävissä ja ymmärrettävissä muissa maissa kerättävän datan kanssa.

Tietoarkiston kokenut ISSP-aineistojen käsittelijä Seppo Antikainen jäi eläkkeelle keväällä ja tällä kirjoituksella haluamme myös antaa tunnustusta ja kiittää häntä sarjan eteen tehdystä työstä. Kiitos Seppo!

ISSP-aineiston keruu Suomessa

ISSP:n logo
ISSP-konsortio kerää maailmanlaajuisesti yhteiskuntatieteellistä dataa. Suomessa ISSP-työryhmässä ovat vastaavat tutkijat Harri Melin ja Sami Borg sekä Tietoarkiston ja Tilastokeskuksen kääntämisen, aineistonkäsittelyn ja -keruun asiantuntijat. Tietoarkisto luovuttaa Tilastokeskuksen keräämän ISSP-datan harmonisoinnista vastaavalle Saksan Gesis-arkistolle.

ISSP:ssä tutkittavat aiheet vaihtuvat vuosittain, mutta sama teema toistuu keruissa säännöllisesti, mikä mahdollistaa pitkittäisvertailun. Aiheina ovat olleet muun muassa sosiaaliset verkostot, eriarvoisuus, perhe- ja sukupuoliroolit, työ, uskonto, vapaa-aika ja urheilu sekä ympäristö. Kansainvälinen harmonisoitu data on saatavilla Gesisistä, mutta Suomen kyselyt myös Tietoarkistosta.

ISSP-prosessi alkaa uuden lomakkeen kääntämisellä

Keruuprosessi alkaa joka vuosi vuoden vaihteessa, jolloin Saksasta ISSP-tiimi lähettää osallistuville maille kyselylomakkeen kommentoitavaksi. Sen perusteella muotoutuu lopullinen kyselylomake. Kyselyn kysymykset ovat jaettavissa kolmeen ryhmään: taustamuuttujiin, vanhoihin sisältökysymyksiin ja uusiin kysymyksiin. Kun lopullinen englanninkielinen lomake on valmis, Tietoarkisto kääntää uudet kysymykset ja tarkistaa, pitääkö vanhoja kysymyksiä päivittää ja onko taustamuuttujiin tullut muutoksia. Vahva pääsääntö on, ettei jo aiemmin kysyttyjä kysymyksiä muuteta, sillä uusi kysymyksenasettelu voi estää aiheen pitkittäistarkastelun kokonaan. Kuitenkin pieniä viilauksia on tehty: esimerkiksi ennen käytetty teitittely on muutettu nykyään sinutteluksi.

Kuvituskuva: Karttapallo
Uusien kysymysten kääntäminen suomeksi englanninkielisestä pohjalomakkeesta on tarkkaa työtä, sillä kysymysten tulee olla ymmärrettävissä suomalaisessa kontekstissa. Kun lopulta kansainvälinen data yhdistetään Gesisissä, tulee kysymysten mitata samaa asiaa. Esimerkiksi vuoden 2020 kyselyssä kääntäjät kokivat hankalaksi kääntää lauseen: How willing would you be to accept a reduction in the size of [country's] protected nature areas, in order to open them up for economic development? Suomen kielessä ei ole suoraa vastinetta termille "economic development", joka viittaa monenlaiseen eri taloudelliseen kehitykseen (esim. louhinta, kaavoitus, hakkuut). Lopullisen voiton käännöksessä vei kuitenkin yksinkertainen versio "taloudellinen hyödyntäminen" sujuvan luettavuuden vuoksi. Lopullinen kysymys on Kuinka halukas olisit supistamaan Suomen luonnonsuojelualueiden kokoa, jotta niitä voitaisiin ryhtyä hyödyntämään taloudellisesti?

Datojen kanssa pilkunviilaus on sallittua

Kun Tietoarkisto on keväällä saanut kyseisen vuoden kyselyn käännettyä suomeksi, se lähetetään Tilastokeskukseen, joka tekee lopulliset lomakkeet. ISSP-kyselyyn voi vastata niin verkossa kuin paperisella lomakkeella. Tämä tarkoittaa useaa tarkistusta ennen lopullista Tilastokeskuksen syksyllä tekemää keruuta. Ensin tarkistetaan Tilastokeskuksen suomenkielinen ja käännetty ruotsinkielinen lomake. Sitten tarkistetaan molempien kielten internetkyselyt, joiden pitää vastata täysin paperilomakkeita. Myös tutkittavien informoinnit tulee kääntää ja tarkistaa.

Datojen parissa työskentelyssä tarkkuutta ja tarkistamista ei voi ylikorostaa. Tarkistamisessa kiinnitetään huomiota siihen, että lomakkeissa kysytään kaikki pakolliset kysymykset, kysymysten vastausvaihtoehdot ovat samat ja että niiden määrä vastaa alkuperäistä englanninkielistä kyselylomaketta.

Datan valmistuminen jatkokäyttöön

Tilastokeskus lähettää keruun valmistuttua datan Tietoarkistoon prosessoitavaksi aineistoportaali Ailaa varten. Suomenkielinen data on saatavissa Ailasta usein jo maaliskuussa, siis noin puolen vuoden kuluttua keruusta. Tuore kysely pääsee heti tutkijoiden ja opiskelijoiden tarkasteluun.

Lisäksi Tietoarkisto käsittelee datasta kansainvälisen version lähetettäväksi Gesisille. Käsittely varmistaa aineiston yhdistettävyyden muiden maiden datojen kanssa. Yksityiskohtaiset ohjeet käsittelyyn, kuten miten muuttujat ja selitteet nimetään, tulevat Gesisiltä. Kansainvälinen data eroaa Ailasta ladattavasta aineistosta esimerkiksi muuttujien numeroinnissa. Lisäksi datassa ei saa olla yhtään puuttuvaa tietoa, jolla ei ole selitettä. Luovutettavaan dataan lisätään myös useita uusia muuttujia, kuten muiden maiden vastauksien kanssa yhteensopiva uskontokuntamuuttuja.

Gesisille tulee lähettää myös tarkat tiedot aineistonkeruusta ja siitä, miten muuttujat on koodattu. Pienimmätkin muutokset, kuten yksittäisen sanan yksikkömuotojen muutos monikkoon, kirjataan ylös. Tällä kaikella työllä halutaan varmistaa laadukas kansainvälinen aineistosarja, joka kestää tarkastelua vielä vuosikymmenien ja vuosisatojen päästä.

Tyylitelty maailmankartta jossa on pistein merkitty, mitä maat ovat mukana ISSP-tutkimuksessa.

ISSP:n jäseninä on tällä hetkellä 42 maata, joista 25 on Euroopasta. Mukana ovat maailmanpoliittisesti merkittävät suuret valtiot kuten Yhdysvallat, Venäjä, Kiina ja Intia.

Lisätietoa:

» Tietoarkiston ISSP-sivut
» International Social Survey Programme -tutkimusohjelma
» Gesisin ISSP-sivut
» ISSP-aineistot Ailassa

Annika Valaranta
tietopalveluasiantuntija
etunimi.sukunimi [at] tuni.fi

15. tammikuuta 2020

Digitaalisen tutkimusdatan pitkäaikaissaatavuutta jo vuodesta 1999

Viime vuonna Tietoarkisto juhli 20-vuotista taivaltaan. Olemme tutkimusaineistojen digitaalisen pitkäaikaissäilytyksen pioneereja Suomessa. Aluksi haimme mallia toimintaamme eurooppalaisilta ja muilta kansainvälisiltä yhteiskuntatieteellisiltä data-arkistoilta, ja työmme käynnistyi ripeästi.

Ensimmäiset pitkäaikaissäilytettävät aineistopaketit valmistuivat vain runsaan puolen vuoden kuluttua Tietoarkiston perustamisesta. Nämä olivat Puolueiden ajankohtaistutkimukset, joiden kuvailut julkaisimme verkkosivuillamme syyskuussa 1999. Jo tätä ennen olimme palvelleet ensimmäistä asiakastamme, kun kesäkuussa 1999 välitimme Eurobarometri-dataa Turun yliopiston tutkijalle.

Datan tekijän ja jatkokäyttäjän kohtaamispaikka

Tällä hetkellä aineistovarannossamme on jo yli 1500 tutkimusdataa ja Aila-dataportaalimme on osa eurooppalaista avoimen tieteen pilvipalvelua EOSC Marketplacea. Palveluillamme on vuosien varrella ollut tuhansia käyttäjiä. Tällä hetkellä Ailassa on yli 2600 rekisteröitynyttä käyttäjää ja verkkosivuillamme vieraillaan reilusti yli miljoona kertaa vuodessa. Ailasta tutkijat, opettajat ja opiskelijat saavat datat käyttöönsä helposti ja maksutta kunkin aineiston käyttöehtojen mukaisesti.

Tutkimusaineiston tallentaminen Tietoarkistoon on myös helppoa. Ennen aineiston siirtoa tehdään käsittelysopimus, jolla varmistetaan muun muassa henkilötietojen vastuullinen käsittely ja aineiston laillinen siirtäminen Tietoarkistoon. Tämän jälkeen Tietoarkiston asiakaspalvelu avaa Ailaan työtilan, jossa tutkija siirtää tiedostot tietoturvallisesti Tietoarkiston aineistopalvelun käsiteltäviksi.1

Huolehdimme saatavuudesta ja ymmärrettävyyden säilymisestä

Tietoarkiston perustehtävä on alusta asti ollut varmistaa digitaalisten tutkimusaineistojen säilyvyys, käytettävyys ja saatavuus tutkijoiden käyttöön sekä nyt että kaukana tulevaisuudessa. Digitaaliset tutkimusaineistot eivät säily itsestään, vaan niitä pitää hoivata koko elinkaaren ajan.

Tietoarkisto seuraa ohjelmistojen kehittymistä ja huolehtii arkistoitujen tutkimusdatojen tiedostomuotojen pysymisestä ajantasaisena ja käyttökelpoisena. Koska tutkimusdatamme sisältävät yleensä tietoa ihmisistä, panostamme tietosuojaan koko tutkimusdatan säilytyksen ajan. Laadimme vuosittain selosteet aineistoihin kohdistuneista tietosuojatoimenpiteistä sekä varmistamme, ettei aineistoihin synny teknologioiden kehittyessä tietosuojariskejä.

Pelkkä datan hoivaaminen ei yksin riitä takaamaan aineiston pitkäaikaista käytettävyyttä. Tarvitaan myös metadataa eli kuvailevaa tietoa aineiston sisällöstä ja taustasta. Tietoarkisto tekee aineistoille laajat, tasalaatuiset kuvailut. Ilman niitä tutkimusdatan arvo ei säily eikä data ole jatkokäyttökelpoista tai tutkimus toistettavaa. Analyysien kannalta on esimerkiksi ihan eri asia, onko data kerätty 1980-luvulla vai 2010-luvulla, onko otanta satunnainen vai ei tai onko otannan perusjoukko Suomen väestö vai helsinkiläiset.

Tietoarkisto tarkkailee jatkuvasti kuvailujen laatua ja ajanmukaistaa ja rikastaa metadataa esimerkiksi ottamalla käyttöön uusia kansainvälisiä sanastoja. Aineistoille annetaan myös pysyvät tunnisteet. Näin Tietoarkisto voi taata datojen pitkäaikaisen käytettävyyden ja kansainvälisen yhteentoimivuuden.

Vuodesta 2017 alkaen olemme hyödyntäneet kansallista pitkäaikaissäilytyspalvelua tutkimusaineistojemme bittitason säilytykseen. Palvelun suunnittelussa ja rakentamisessa olemme olleet mukana vuodesta 2008 ja pilotointivaiheemme alkoi 2015.

Sertifiointi luotettavuuden merkkinä

Tietoarkiston asiantuntijoiden pitkäjänteisen, jatkuvan, huolellisen ja innovatiivisen työn tuloksena olemme onnistuneet kehittämään ja rakentamaan toimivat prosessit, jotka varmistavat aineistojen pitkäaikaissaatavuuden. Tästä osoituksena saimme Data Seal of Approval (DSA) -sertifikaatin vuonna 2014 ensimmäisenä suomalaisena PAS-organisaationa. Tällä hetkellä meillä on voimassa vaatimuksiltaan DSA:ta tiukempi CoreTrustSeal (CTS) -sertifikaatti.

1 Lue lisää: Tietoarkistoblogi 9/2018: Ailassa nyt tallennustyökalu aineistojen arkistointiin ja Ohjeita aineiston arkistoijalle.

Lisätietoa:

» Tietoarkiston CoreTrustSeal-sertifikaatti (PDF)
» Aila
» Aila EOSC Marketplacessa
» Tietotilinpäätökset
» Tietoarkistoblogi: Tietoarkisto jatkaa uudella vuosikymmenellä luotettuna tutkimusaineistojen asiantuntijana

Mari Kleemola
kehittämispäällikkö, varajohtaja

Katja Moilanen
tietoarkkitehti

etunimi.sukunimi [at] tuni.fi

20. toukokuuta 2019

Anonymisointi luontevaksi osaksi tutkimusprosessia

Aineistonhallinta vaatii tutkijalta entistä enemmän osaamista. Tutkijan tulisi opiskella muuttuneet tietosuojakäytänteet ja toisaalta pitäisi pystyä vastaamaan myös datan avoimuuden haasteeseen. Usein aineiston arkistoiminen jatkokäyttöön on mahdollista vain anonyyminä. Anonymisoinnin osaaminen ja resursointi nousevat tässä vaiheessa keskeiseen asemaan. Tutkijoiden näkökulmasta lisävaatimukset eivät ole aina mieluisia, sillä usein anonymisointiin ei ole varattu aikaa ja toisaalta ei ole myöskään tietoa, miten aineisto saatetaan anonyymiksi. Jonkin pitää muuttua, mutta miten?

Mieti anonymisointia jo tutkimusprosessin alussa

Uudet vaatimukset otetaan haltuun muuttamalla käsitystä anonymisoinnista ja kasvattamalla anonymisoinnin osaamista. Tästä lähtien tutkimusprojekteissa tulee jo alkuvaiheessa resursoida anonymisoinnin suunnitteluun ja toteuttamiseen. Käsitys siitä, että anonymisointi on jotain, jota tehdään vain aineistonkeruuvaiheessa poistamalla suorat tunnisteet tai tutkimusprosessin loppuvaiheessa ennen arkistointia, tulisi heittää romukoppaan.

Ensinnäkään anonymisointi ei ole vain suorien tunnisteiden poistamista, vaan vaatii laajemman aineiston sisällön tarkastelun ja tietojen suhteuttamisen ulkopuolelta saataviin tietoihin. Anonymisoinnissa pyritään ymmärtämään, minkä tiedon poistaminen on tarpeellista, ja miten tietojen poistaminen vaikuttaa aineiston käytettävyyteen. Toiseksi anonymisointia tulee miettiä jo tutkimusprosessin alussa, sillä henkilötiedot tulee kerätä tietosuoja-asetuksen minimoinnin periaatteen mukaan eli keräämällä vain tutkimuksen kannalta tarpeellisia tietoja. Henkilötietojen keruun huolellisella suunnittelulla voi vähentää oleellisesti anonymisointiin myöhemmin kuluvaa aikaa.

Miten kerättäviä tietoja voi minimoida?

Määrällisissä aineistonkeruissa anonymisointia vaativien tietojen keruuta pystyy minimoimaan tehokkaasti välttämällä avokysymyksiä, joiden sisältöä tutkija ei voi kontrolloida. Kannattaa välttää myös kysymyksiä, joiden perusteella vastaajasta paljastuu kohdejoukkoon nähden harvinaisia tietoja. Tietoja suositellaan kerättäväksi valmiiksi luokiteltuna, niin että kysytään esimerkiksi yksittäisen harrastuksen sijaan harrastustyyppiä. Kirjoitettavan avovastauksen "pelaan jalkapalloa Äänekosken Huimassa" sijaan vastaaja voi valita esimerkiksi luokitellun arvon "palloilulajit", eikä tutkijan tarvitse anonymisoida paikkakuntaa ja seuraa. Erityisesti taustatietojen kysyminen luokiteltuna ehkäisee oleellisesti myöhäisempää anonymisointitarvetta niin kvalitatiivisissa kuin kvantitatiivisissa aineistoissa.

Laadullisissa aineistoissa sisällön etukäteen rajoittaminen on hankalampaa, mutta sitä voi helpottaa muutaman hyödyllisen vinkin avulla. Esimerkiksi haastatteluissa ja kirjoitusaineistoissa haastateltavien taustatiedot kannattaa kerätä strukturoituna, henkilöiden vapaamuotoisten esittelyjen sijaan. Haastattelun aluksi haastattelija voi esimerkiksi pyytää iän, ammatin ja lasten lukumäärän luokiteltuna. Haastateltavia voi myös muistuttaa aluksi ystävällisesti, jos haastattelun luonne antaa siihen mahdollisuuden, että he eivät kertoisi ihmisten oikeita nimiä tai muita tarkkoja tietoja. Tutkija voi myös välttää liian yksityiskohtaista tietoa tuottavien kysymysten esittämisen.

Yleisimmät ongelmat anonymisoinnissa

Koska anonymisointiin ei ole valmiina kaikkiin aineistoihin sopivia ohjeistuksia, se voidaan kokea haasteellisena. Usein ongelmana on hahmottaa, mitä tietoja tulee anonymisoida ja mitä tietoja voidaan jättää. Tutkija saattaa myös ajatella, ettei sensitiivistä aineistoa voi saattaa anonyymiksi. Anonymisoinnin jälkeen tutkijan mieleen voi hiipiä myös pelko siitä, onko aineistoa anonymisoitu tarpeeksi.

Ensinnäkin tulee muistaa, että aineiston sensitiivisyys ei ole lähtökohtaisesti este aineiston anonymisoinnille ja jakamiselle. Sensitiivisen aineiston anonymisointi voidaan suunnitella samalla tavoin kuin ei-sensitiivisiä tietoja sisältävän aineiston. Merkityksellisintä on henkilöistä saatavien taustatietojen ja muiden aineiston sisältämien tietojen karkeistaminen tai poisto tasolle, josta yksittäisiä henkilöitä ei pysty tunnistamaan. Sensitiivisen aineiston anonymisointi voi kuitenkin olla haasteellista, sillä aineiston luonteen vuoksi rajoitettavia tietoja voi olla paljon.

Anonymisointitarpeen hahmottamisen helpottamiseen tarvitaan ohjeistusta ja tarve konkreettisille anonymisointiohjeille on suuri. Ennen anonymisoinnin ohjeistus keskittyi usein anonymisoinnin menetelmien, kuten karkeistuksen ja luokitteluiden, esittämiseen, ei anonymisointipäätösten tekemisestä ohjeistamiseen. Ohjeistuksen tarpeeseen vastatakseen Tietoarkisto on päivittänyt anonymisoinnin ohjeistuksiaan viimeksi viime kuussa. Ohjeistuksiin lisättiin erityisesti tukea anonymisoinnin suunnitteluun. Ohjeista löytyy nyt myös havainnollistavia esimerkkejä ja mallipohjia anonymisointisuunnitelman tekoon.

Anonymisoinnin tarpeen hahmottaminen

Kun haluaa anonymisoida oman tutkimusaineistonsa, sille kannattaa tehdä anonymisointisuunnitelma, josta käy ilmi tunnisteellisuuden kannalta tärkeimmät aineiston tiedot ja tehdyt anonymisointipäätökset ja -toimet. Anonymisoitavien tietojen hahmottamiseen auttaa seuraavien tärkeimpien asioiden muistaminen ja tarkastelu:

  • Suorat tunnisteet poistetaan aina!
  • Keitä ja mitä tutkit? Henkilöiden tunnistettavuus riippuu paljon tavoitellun kohdejoukon määrästä ja tutkittavasta ilmiöstä. Mitä pienempi kohdejoukko ja mitä enemmän heistä on saatavilla tietoa, sitä vähemmän yksityiskohtaista tietoa henkilöistä voidaan jättää aineistoon.
  • Anonymisoinnissa pyritään eroon harvinaisista tiedoista, joiden perusteella yksittäinen henkilö tai rypäs on tunnistettavissa. Anonymisoitavia tietoja pohditaan aina suhteessa tutkimuksen perusjoukkoon. Tieto on harvinainen vain, jos ominaisuus on harvinainen kohdejoukossa. Pienet jakaumat eivät ole näin yksiselitteisesti harvinaista tietoa. Harvinaistakaan tietoa ei tarvitse anonymisoida, jos tietoa henkilöstä ei voida saada selville.
  • Pohdi, voiko henkilö olla tunnistettavissa yhdistämällä aineiston tietoja toisiinsa. Pohdi myös, mitä tietoja tutkittavista voi olla saatavilla ulkoisista lähteistä, kuten sosiaalisesta mediasta, ja voiko tietoja yhdistää datan sisältämiin tietoihin. Esimerkiksi LinkedInissä on useamman suomalaisen koulutus- ja työhistoria julkisesti nähtävillä.
  • Sensitiivisten tietojen anonymisointi on tarpeellista, mikäli niiden perusteella voi tunnistaa tai päätellä yksittäisen henkilön tai henkilöitä. Jos sensitiivisten asiasisältöjen tutkiminen on tutkimuksen kannalta keskeistä, tietoja ei tietenkään poisteta, vaan aineisto pyritään tekemään anonyymiksi muita henkilöihin viittaavia tietoja poistamalla.
  • Jos aineisto vaatii anonymisointia, se voidaan toteuttaa monin eri tavoin. Pyri poistamaan tietoja, jotka ovat vähemmän tärkeitä tutkimusilmiön kannalta ja säilyttämään tärkeimmät taustatiedot. Esimerkiksi, jos kuntatasoinen muuttuja aluetietona on tutkimuksen kannalta merkityksellinen, anonymisointia voi tehdä esimerkiksi vastaajan perhe- tai tulotietoihin.

Lisätietoa ja tarkemmat ohjeet löydät Tietoarkiston aineistonhallinnan käsikirjasta.

Anonymisoinnin kartoittamisen jälkeen voi jopa olla että anonymisointia ei välttämättä tarvitsekaan tehdä. Tällainen tilanne voi olla esimerkiksi väestötutkimuksissa, joissa aluemuuttuja on kerätty vain maakunnan tasolla ja muiden tietojen perusteella henkilöt eivät ole yksilöitävissä tai liitettävissä harvinaisiin ryhmiin. Anonymisointisuunnitelman tekeminen on siis suositeltavaa, jotta tutkimusprosessin aikana aineistoa tulee tarkasteltua kerran yksinomaan tunnisteellisuuden näkökulmasta. Lisäksi suunnitelma toimii hyvänä dokumentaationa aineistoille tunnisteellisuussyistä tehdyistä muutoksista, mikäli aineisto luovutetaan jatkokäyttöön.

Et ole anonymisointipulmiesi kanssa yksin

Anonymisoinnin riittävyys on yleinen tutkijoiden huoli, ja se on hyvin ymmärrettävää. Tulee kuitenkin muistaa, että anonyymiksi voidaan määritellä aineisto, josta ei kohtuullisen todennäköisesti käytettävissä olevin keinoin voi tunnistaa tai päätellä henkilöitä. On jo paljon, että aineiston anonymiteettiä ja henkilöiden paljastumisriskiä on pohdittu ja se on kirjattu anonymisointisuunnitelmaan. Lisäksi on hyvä muistaa, että aineistolle voidaan tehdä lisäanonymisointia myöhemminkin. Aineistolle tulee tehdä säännöllisesti jäännösriskin arviointi, jossa tarkastellaan anonymiteettiä uudelleen. Se on tarpeellista tiedon lisääntymisen ja tekniikan kehittymisen vuoksi.

Tavoitteet anonymisoinnin käsitysten muuttamisesta ja osaamisen levittämisestä ovat alkuvaiheessa. Toivomme, että anonymisointi nähdään mahdollisuutena lisätä tieteen avoimuutta ja luotettavuutta. Asiasta tarvitaan myös keskustelua ja näkemyksiä. Otamme niitä mielellämme vastaan täällä Tietoarkistossa!

Annika Sallinen
tietopalveluasiantuntija
etunimi.sukunimi [at] tuni.fi

27. huhtikuuta 2018

Uudet sopimusmallit tutkimusaineistojen arkistointiin

Tietoarkisto on uudistanut tutkimusaineistojen arkistointia koskevat yleiset sopimusmallinsa vastaamaan tietosuoja-asetuksen (2016/679) vaatimuksia. Sopimuksia kehitettäessä on lähtökohtana ollut Tietoarkiston tutkijoille tarjoamien palvelujen luotettavuus ja laillisuus.

Rekisterinpitäjä, joka luovuttaa tutkimusaineiston Tietoarkistoon käsiteltäväksi, täyttää uusien sopimusten myötä tietosuojalainsäädäntöön perustuvat omat velvoitteensa, joita edellytetään sopimuksen sisällöstä 25.5.2018 jälkeen. Sopimusjärjestely suojelee samalla tutkittavia huolehtimalla tietosuojan ja -turvan korkeasta tasosta heidän tietojaan käsiteltäessä.

Miksi sopimusmallien päivittäminen oli tarpeellista?

Sopimuksia solmittaessa yleinen lähtökohta on sopimusvapaus, johon kuuluvat muun muassa sisältövapaus ja muotovapaus. Poikkeuksia sopimusvapauteen on pakottavassa lainsäädännössä. Tietosuoja-asetus laajentaa henkilötietolailla (523/1999) kansallisesti toimeenpannun tietosuojadirektiivin (95/46/EY) sopimuksille asettamia vaatimuksia. Tietosuojasopimuksia koski aiemmin etenkin tietosuojadirektiivin 17 artikla, joka edellytti huolehtimaan lähinnä yleisellä tasolla käsittelyn turvallisuudesta ja seuraamaan rekisterinpitäjän ohjeita. Direktiivistä poiketen uusi tietosuoja-asetus määrittelee yksityiskohtaisesti rekisterinpitäjän ja henkilötietojen käsittelijän välisen sopimuksen sisältöä ja muotoa.

Tietoarkisto toimii useimmiten henkilötietojen käsittelijän roolissa tutkimusaineiston toimittaneen rekisterinpitäjän lukuun. Tietosuoja-asetuksen edellyttämät yksityiskohtaiset ehdot on sisällytetty arkistointisopimuksen liitteeksi. Aineiston jatkokäyttöä koskevat perusratkaisut on arkistointisopimuksessa jätetty ennalleen. Jos henkilötietoja sisältävä tutkimusaineisto toimitetaan Tietoarkistolle ennen arkistointisopimuksen tekemistä, solmitaan luovuttajan ja Tietoarkiston välille erillinen sopimus henkilötietojen käsittelystä arkistointiedellytysten arvioimiseksi.

Kaikki tutkimusaineistot eivät tietenkään sisällä henkilötietoja. Joskus tätä on vaikea arvioida etukäteen tarkastelematta aineistoa. Tämän vuoksi henkilötietojen käsittelyä koskevat sopimusehdot on otettu osaksi kaikkia sopimuksia.

Mitä hyötyä uusista sopimusehdoista on?

Uusilla sopimusehdoilla on useita etuja aineiston luovuttavan rekisterinpitäjän kannalta. Rekisterinpitäjän kannalta henkilötietojen käsittelyä koskevat yksityiskohtaiset sopimusehdot

  • auttavat toteuttamaan tietosuoja-asetuksen 5 artiklan 2 kohdan mukaista osoitusvelvollisuutta
  • lisäävät tutkittavien luottamusta henkilötietojen vastuulliseen käsittelyyn
  • mahdollistavat tutkimusaineiston laillisen siirtämisen Tietoarkiston käsiteltäväksi
  • voidaan ottaa huomioon tietosuojaa koskevassa vaikutustenarvioinnissa.

Sopimusehdoilla on myös etuja aineiston luovuttajan ja Tietoarkiston väliselle yhteistyölle. Sopimus

  • parantaa tiedonkulkua sopijapuolten välillä
  • vahvistaa henkilötietojen käsittelyn turvallisuutta
  • selkeyttää työnjakoa.

Lisätietoa:

» Sopimus henkilötietojen käsittelystä arkistointiedellytysten arvioimiseksi (PDF)
» Arkistointisopimus (PDF)

Antti Ketola
lakimies
etunimi.sukunimi [at] uta.fi

Tämä blogikirjoitus on luettavissa myös englanniksi:
New contract models for archiving research data.

New contract models for archiving research data

The Finnish Social Science Data Archive (FSD) has updated its general contract models for archiving research data to fulfill the requirements imposed by the General Data Protection Regulation (2016/679, "GDPR"). Central goals in the development process were to maintain trust and ensure the legality of the services provided by FSD to researchers.

Data controllers depositing research data to FSD for processing fulfil their obligations imposed by data protection legislation on the contents of the contract by using the new contract models. The new legislation is enforceable from 25 May 2018. The contractual arrangement also protects research subjects by ensuring high level of data protection and data security.

Why was it necessary to update the contract models?

Freedom of contract is a general principle that includes, for example, freedoms of content and form. Exceptions to freedom of contract usually stem from consumer protection legislation or competition law, for instance. The GDPR broadens the requirements set for contracts between data controllers and data processors, when compared to Directive 95/46/EC on data protection which was implemented in the Finnish legislation by the Personal Data Act (523/1999). Previously, the terms and clauses in contracts on data protection were governed by Article 17 of the Directive. Article 17 contained a rather general requirement to stipulate in a contract on the security of data processing and that the processor follows the instructions of the data controller. In contrast, the GDPR contains detailed provisions on the content and form of a contract between a data controller and a data processor.

In most cases, FSD acts as the data processor on behalf of the data controller who has deposited the research data. The detailed contractual terms required by the GDPR have been included in the annex of the deposit agreement. The fundamental solutions regarding data reuse have been left intact in the agreement. In the event where research data containing personal information is delivered to FSD before a deposit agreement is concluded, the situation is covered by a separate agreement on personal data processing for assessing the suitability of research data for archiving.

All research data do not necessary contain personal data. This is often difficult to evaluate at the outset without reviewing the data in more detail. For this reason, the contractual terms regarding the processing of personal data have been included in all contracts.

Benefits of the new contract terms

The new contractual terms have multiple benefits for data controllers depositing research data. From their point of view, the detailed contract terms on personal data processing

  • facilitate fulfilling the data controller's obligation of accountability in accordance with Article (5)(2) of the GDPR
  • increase research participants' confidence in responsible handling of their data
  • allow to legally transfer research data to FSD for processing
  • can be taken into account when performing data protection impact assessment (DPIA).

The contract terms also have benefits for the cooperation between the depositor and FSD. The contract

  • enhances communication between the contracting parties
  • strengthens the security of personal data processing
  • clarifies the division of obligations and duties.

Additional information:

» Agreement on personal data processing for assessing the suitability of research data for archiving (PDF)
» Deposition Agreement (PDF)

Antti Ketola
lawyer
firstname.surname [at] uta.fi

This blog post is available also in Finnish:
Uudet sopimusmallit tutkimusaineistojen arkistointiin.

26. elokuuta 2016

Miten aineistot arkistoituvat Tietoarkistoon?

Kun tutkija tai tutkijaryhmä on lähettänyt tutkimusaineistonsa Tietoarkistoon arkistoitavaksi, varsinainen aineiston käsittelyprosessi vasta alkaa. Arkistoitavaksi toimitettu aineisto kulkee aina aineistonkäsittelijän sormien läpi ennen kuin se julkaistaan palveluportaali Ailassa jatkokäyttöä varten.

Erilaiset tietokoneohjelmat helpottavat, nopeuttavat ja virtaviivaistavat aineiston käsittelyä, mutta loppujen lopuksi aineiston käsittelyyn liittyvän työn tekevät ihmiset eivätkä koneet. Näin pystymme varmistamaan, että mitä moninaisimmat aineistot ovat tulevaisuudessakin tutkimusmaailman käytettävissä yhdenmukaiseksi suunniteltujen ohjeidemme mukaisesti.

Aineistonkäsittelijäntyö on Tietoarkiston ydintyötä, jota ilman Ailassa ei olisi jatkokäyttökelpoisia aineistoja. Tietoarkiston pitkäaikaiset tutkimusapulaiset Eliisa Haanpää (kvantitatiivisten aineistojen käsittely) ja Annika Sallinen (kvalitatiivisten aineistojen käsittely) kertovat, minkälaista aineistonkäsittelijän työ on, ja minkälaisen prosessin aineistot käyvät läpi ennen kuin ne ilmestyvät Ailaan.

Kyselytutkimukset arkistoituvat muuttuja muuttujalta

Eliisa

Aloitan kvantitatiivisen aineiston käsittelyn aina tutustumalla aineistoon, siihen sisältyviin muuttujiin sekä aineistoon liittyvään tutkimusraporttiin ja lisämateriaaliin. Avattuani datatiedoston, tarkastan ensimmäisenä kaikki muuttujat ja varmistan, että käsiteltävä data vastaa kyselylomaketta. Nimeän muuttujat kyselylomakkeen mukaisesti, mihin perustuen määrittelen myös muuttujien selitteet.

Tämän jälkeen arvioin aineiston tunnisteellisuutta ja arkaluontoisuutta, jonka jälkeen teen tarvittavat toimet vastaajien anonymiteetin säilyttämiseksi. Tässä vaiheessa apunani ovat usein Tilastokeskuksen erilaiset alue-, toimiala- ja tieteenalaluokitukset. Lopuksi vielä varsinaista dataa käsitellessäni tarkistan muuttujien frekvenssit suhteessa tutkimusraporttiin.

Käsittelen dataa SPSS:n syntaksin avulla. Numeroista ja loogisesta päättelystä pitävänä ihmisenä syntaksin työstäminen on mielestäni palkitsevaa puuhaa. Syntaksin tekemiseen sisältyy monia yksin ja yhdessä kollegojen kanssa pohdittavia haasteita, useita onnistumisen kokemuksia, kun komennot toimivat toivomallani tavalla ja tietysti työni kannalta tärkein tuotos, jatkokäyttöön valmistuva datatiedosto.

Varsinaisen datan valmistuttua siirryn aineiston kuvailuun, johon kuuluu muuttujien kuvailu sekä aineiston sisällöllinen kuvailu. Tietopankkina sisällöllistä kuvailua tehdessäni käytän tutkimusraporttia ja sieltä löytyviä aineistonkeruuseen liittyviä tietoja. Aineiston (eli datan sekä aineiston kuvailun) käsittelyn valmistuttua kirjaan tietokantaamme "data valmis"-komennon, jonka jälkeen aineisto julkaistaan palveluportaali Ailassa.

Aineistoja käsitellessäni olen oppinut paljon paitsi tilastollisista menetelmistä ja kyselytutkimuksista, myös eri tieteenalojen tutkimusteemoista. Olen tähän mennessä käsitellyt aineistoja liittyen muun muassa lasten ja nuorten mediakäyttäytymiseen, lasten uhrikokemuksiin, suomalaisten hyvinvointiin, eduskuntavaaleihin, asumiseen ja kaupunkikuvaan, opiskeluun sekä vapaaehtoistoimintaan.

Aineiston käsittelyn eri vaiheissa olen yhteydessä yhteen tai useampaan tutkijaan, mikäli tarvitsen aineistosta lisätietoja. Yhteistyö sekä tutkijoiden suuntaan että kollegoiden kanssa on erittäin merkittävässä osassa työskentelyssäni aineistojen parissa.

Kvalitatiivisessa aineistossa tallentuu aina pala aikaa

Annika

Kvalitatiivisten aineistojen arkistointi poikkeaa kvantitatiivisten aineistojen arkistoinnista sikäli, ettei siinä tarvitse pohtia syntaksin komentoja, mutta lukulihaksia työ vaatii senkin edestä. Luemme tänne toimitetuista haastatteluista ja kirjoituksista jokaisen sivun. Tämä täytyy tehdä huolellisesti, että ihmisten tunnistetietoja ei jää luovutettavaan aineistoon. Tekstimassaa saattaa olla yhdessä aineistossa jopa lähes tuhat sivua.

Kvalitatiivisten aineistojen tarkastaminen on siis välillä uppoutumista lukemiseen, mutta työ sisältää myös järjestelmällistä tiedon poimimista sekä järjestelyä ja tietokoneohjelmien kanssa kikkailua - mikä on aina oma taiteenlajinsa.

Dokumentit nimetään järjestelmällisesti. Aineistojen taustatiedot järjestetään yhdenmukaisiksi ja niistä tehdään taustatietohakemisto jatkokäyttäjälle. Työssä käytetään lukuisia ohjelmia, joista tekninen palvelu keskustelee mm. termeillä DDI, HTML ja Python - minä keskityn opettelemaan konkreettisen käytön.

Koko arkistointiprosessin ajan teen muistiinpanoja eteen tulleista ongelmakohdista, niiden ratkaisuista ja vielä tehtävistä vaiheista. Listalla voi olla selvitettävänä, mitä tutkijan kryptinen merkintä muistiinpanoissa tarkoittaa, mihin teollisuusalaan karkeistetaan Suomussalmen Hallan lihajalostamo, sisältävätkö dokumentit piilodataa ja saisiko 400 erillisen tiedoston nimet muutettua automaattisesti toiseen muotoon, jotta kaikkea ei tarvitsisi tehdä käsin.

Kaikkeen löytyy yleensä vastaus, joko kollegoilta, tutkijoilta tai yhdeltä tärkeältä työkaverilta - internetistä. Netti on ollut oiva apu esimerkiksi tilanteessa, jossa oman pään kapasiteetti keksiä suomalaista naisten nimiä on tullut tiensä päätökseen.

Minun mielestäni kvalitatiivisten aineistojen arkistointi on erittäin mielenkiintoista, sillä tutkimusaineistoon perehtyminen on aina oma matkansa jonkin tieteenalan ja alueen tutkimuksen pariin. Aineistoja läpi kahlatessa oppii uusia käsitteitä ja ymmärtää taas elämää eri näkökulmista ehkä hitusen paremmin. Tutkittavat kertovat tutkijalle elämästään asioita, joita eivät muille välttämättä kerro. Työ sisältää myös varjopuolia. Koska kaikki työvaiheet vaativat tarkkuutta ja keskittymistä, silmien ja lukuhermojen ajoittaiselta väsymisiltä ei voi välttyä.

Arkistoinnin loppusuoralla kirjoitetaan vielä nettisivuille tuleva kuvaus aineistosta ja hiotaan aineiston yksityiskohtia. Esimerkiksi taustatietoihin tulee helposti virheitä. Minun tulee myös tarkastaa, että aineistoon on liitetty mukaan tutkimuskutsut, haastattelukysymykset ja muut tarvittavat dokumentit. Lisäksi haastattelukysymykset tulee tallentaa Aila-hakuun. Julkaisun jälkeen menen vielä nettisivuille katsomaan, että aineisto näyttää siellä siltä, miltä sen pitääkin!

Lisätietoa:
» Palveluportaali Aila

Annika Sallinen, tutkimusapulainen, etunimi.sukunimi [at] uta.fi
Eliisa Haanpää, tutkimusapulainen, etunimi.sukunimi [at] uta.fi