Näytetään tekstit, joissa on tunniste tietoarkistot. Näytä kaikki tekstit
Näytetään tekstit, joissa on tunniste tietoarkistot. Näytä kaikki tekstit

4. helmikuuta 2026

FIDELIS pilot support offers helped to strengthen the upskilling of repositories

In this first project update of 2026, you will get an overview of the pilot trainings carried out within the FIDELIS project.

The European Open Science Cloud (EOSC) aims to develop a web of FAIR (Findable, Accessible, Interoperable, Reusable) data and services for science in Europe. One of the main objectives of the FIDELIS project is to Strengthen the upskilling of repositories and expansion of the Network through an active training and support programme.

At the end of 2025, the project organised three pilot training offers for provisional members of the FIDELIS Network, bringing together a total of 34 participants from several countries (see figure 1). The goal of pilot training was to support repositories to implement and adopt good practices, tools, services, and other solutions to increase their trustworthiness. From the perspective of the FIDELIS project, a key objective was to prepare and develop the necessary logistics, materials, and processes for this type of support for the training planned for 2026.

Figure 1: Countries represented by the participating repositories. Source: D8.1 - Implementation report on support for "early adopters" and training interventions.

The pilot round includes three different support offers. The first instructed participants to the TTRAM tool developed within the project. The second offered participants the opportunity to receive support for CoreTrustSeal certification. The third one, in turn, provided participants with the opportunity to explore the FAIR EVA tool.

The TTRAM (Enhancing Repository Transparency and Trustworthiness) training highlighted the benefits TTRAM brings organisations, particularly in assisting repositories with managing digital objects, strengthening organisational infrastructure, and technology and security management. Participants considered the goals of the pilot training as important and perceived TTRAM as being able to serve as a practical guideline for self-assessment, helping participants examine their practices more critically. You can read more about the implementation and experiences in the Implementation Story.

The aim of the second pilot training, an Explorer & Pathfinder track for CoreTrustSeal, was to help organisations explore and apply the CoreTrustSeal requirements. By the end of the support offer, participants had strengthened their understanding of CoreTrustSeal requirements and learnt to relate the current state and maturity of their repository to the requirements of the core criteria. You can read more about the implementation and experiences in the Implementation Story.

The third training, FAIR EVA (Evaluator, Validator & Advisor) plugin, introduced repository managers and technical staff to the FAIR EVA evaluator, validator and advisor tool and guided them through the development of a custom plugin tailored to their repository. Through the training participants started the creation of their own plugin, or at least a proof of concept as customising the tool to work with all metadata schemas and controlled vocabularies takes some effort to define. You can read more about the implementation and experiences Implementation Story.

The project will continue to provide training and support. You can read more about it on FIDELIS Training & Support programme | Eden-Fidelis.

Henna Kaartinen
Project Assistant
firstname.surname [at] tuni.fi

FIDELIS-pilottikoulutukset vahvistivat data-arkistojen osaamista

Vuoden 2026 ensimmäisessä hankepostauksessa pääset tutustumaan FIDELIS-hankkeen toteuttamiin pilottikoulutuksiin.

FIDELIS rakentaa eurooppalaisen luotettavien repositorioiden verkoston, edistää yhteentoimivuutta, kehittää parhaita käytäntöjä ja tarjoaa repositorioille koulutusta ja tukea. Hankkeen yksi keskeisistä tavoitteista on vahvistaa repositorioiden osaamisen kehittämistä ja laajentaa verkostoa aktiivisen koulutuksen ja tuen ohjelman kautta.

Loppuvuodesta 2025 toteutettiin kolme pilottikoulutusta, jotka olivat avoimia FIDELIS-verkoston jäsenille. Niihin osallistui yhteensä 34 osallistujaa useista eri maista (kuva 1). Pilottikoulutuksien tavoitteena oli tukea repositorioita ottamaan käyttöön ja omaksumaan hyviä käytäntöjä, työkaluja, palveluita sekä muita ratkaisuja kehittääkseen luotettavuuttaan. Hankkeen toteuttamisen näkökulmasta puolestaan keskeistä oli kehittää tarvittavia käytännön järjestelyjä, materiaaleja ja prosesseja vuoden 2026 varsinaisia koulutuksia varten.

Kuva 1: Osallistuvien repositorioiden edustamat maat. Lähde: D8.1 - Implementation report on support for "early adopters" and training interventions.

Pilottikierroksen ensimmäinen koulutusvaihtoehto päästi osallistujat tutustumaan hankkeessa kehitettyyn TTRAM-työkaluun. Toinen tarjosi osallistujille mahdollisuuden saada tukea CoreTrustSeal-sertifiointiin ja kolmannessa puolestaan osallistujat saivat mahdollisuuden tutustua FAIR EVA -työkaluun.

TTRAM-koulutuksen tavoitteena oli tuoda esille työkalun hyötyjä, erityisesti repositorioiden apuna digitaalisten objektien hallinnassa, organisaation infrastruktuurin vahvistamisessa sekä teknologian ja turvallisuuden hallinnassa. Osallistujat kokivat tavoitteen tärkeäksi ja kokivat TTRAMin mahdollisesti toimivaksi repositorioissaan, esimerkiksi itsearvioinnin ja omien toimintatapojen kriittisen arvioinnin tukena. Pääset tutustumaan TTRAM-koulutuksen toteutukseen ja kokemuksiin toteutustarinassa.

CoreTrustSeal-koulutuksen tavoitteena oli auttaa organisaatioita CoreTrustSeal-vaatimusten täyttämisessä. Osallistujat pääsivät vahvistamaan ymmärrystään vaatimuksista ja oppivat suhteuttamaan nykytilansa ja kypsyystasonsa näiden kriteerien vaatimuksiin. Pääset tutustumaan CoreTrustSeal-koulutuksen toteutukseen ja kokemuksiin toteutustarinassa.

FAIR EVA –koulutus tarjosi mahdollisuuden perehdyttää repositorioiden ylläpitäjiä ja teknistä henkilöstöä FAIR EVA-arviointi-, validointi- ja -neuvontatyökaluun sekä räätälöimään repositorioihinsa sopivan lisäosan. Koulutuksen myötä osallistujat aloittivat oman lisäosan - tai sen "proof of concept" -version kehittämisen. Työkalun räätälöinti kaikkien metatietomallien ja kontrolloitujen sanastojen kanssa vaatii suhteellisen paljon työtä. Pääset tutustumaan FAIR EVA -koulutuksen toteutukseen ja kokemuksiin toteutustarinassa.

Hanke jatkaa koulutuksen ja tuen tarjoamista tänäkin vuonna. Voit lukea lisää FIDELIS-verkkosivuilta.

Mukavaa alkanutta vuotta toivottaen,

Henna Kaartinen
projektiassistentti
etunimi.sukunimi [at] tuni.fi

12. marraskuuta 2025

FSD's AILA Service Portal 2.0: Current Updates from the Developers

The AILA service portal is a data deposit, discovery and delivery system for archived research data. I met with the development team to discuss the latest updates on the development work. Our conversation focused particularly on the background of the service’s development, its current stage, and the next steps.

What is AILA?

In addition to serving as FSD’s data catalogue, data deposits are also managed through AILA. The entire AILA service portal is developed in-house by FSD and was originally launched in May 2014. The current development of AILA 2.0 began as part of the Research Council of Finland-funded project Cross-Border Tools and Services (C-BOTS 2019–2024). For FSD and its clients, AILA is a central and essential service, and maintaining and developing it is one of the Archive’s core responsibilities. Metadata from AILA is harvested to the CESSDA Data Catalogue.

Why is AILA 2.0 being developed?

The reasons and objectives behind the development of AILA portal are based on several complementary perspectives, such as technical, user-oriented, and accessibility-focused considerations.

Societal changes affect all areas of activity in our society. With the advance of digitalisation, the pace of web application development has accelerated, customer needs have evolved, and accessibility requirements have increased. The development team emphasised that there was a recognised need to renew the technical environment to ensure that the AILA service portal can remain secure and interoperable in the future.

In addition, a key focus now and in the future is customer orientation, highlighting the need for a smoother and more accessible service.

Accessibility in the context of websites and applications refers to similar principles as physical accessibility in the built environment, such as the ability to move through spaces smoothly regardless of potential personal mobility limitations.

Our discussion strongly underscored the importance of collaboration, as the development team and other contributors bring extensive expertise from different areas, such as content knowledge, metadata, and user experience.

What has been developed?

After identifying development needs, the AILA portal has been systematically renewed under the guidance of the development team, in collaboration with other FSD staff and stakeholders.

  1. Aila’s data security is being improved by upgrading the hashing functions for secrets to more secure and modern, tightening password requirements and secrets management practices, and securing administrative interfaces at the network level
  2. Accessibility is being enhanced by ensuring that text and other elements in the application have appropriate size and colour contrast, taking visual impairments into account. In addition, AILA 2.0 will be fully navigable using keyboard only. The development work has also considered Aila’s clients who use screen readers or other assistive technologies.
  3. Search functions have been improved to make it easier and more efficient for clients to locate the datasets they need. Below is a comparison of the old and new Aila search functions.

AILA’s current advanced search allows filtering by availability, data type, language, temporal coverage of the study, and unit of observation.

Image 1: Aila’s current advanced search.

The next screenshot shows AILA 2.0’s advanced search. In the new Aila, filtering options have been expanded, and it is now possible to filter searches by, for example, the year of data collection.

Image 2: Aila 2.0’s advanced search. Click the image to view it larger.

What’s next?

The Aila 2.0 development team will continue their work. Once AILA 2.0 reaches the deployment phase, developers will be able to focus more closely on areas requiring further refinement. You can learn more about the updates in an upcoming article.

In the next project news, we will continue with the AIMS project, where we will discuss artificial intelligence from the perspective of the Data Archive.

See this blog entry in Finnish.

Henna Kaartinen
Project Assistant
firstname.surname [at] tuni.fi

28. lokakuuta 2025

AILA 2.0: Kehittäjien ajakohtaisia kuulumisia

Tapasin Tietoarkiston AILA 2.0 -kehittäjätiimin aiheenani ajankohtaiset kuulumiset kehitystyöstä. Kävimme keskustelua erityisesti palvelun kehitystyön taustasta, tämänhetkisestä vaiheesta sekä seuraavista askelista.

Mikä on AILA?

Palveluportaali AILA on tietoarkistolaisten itse toteuttama arkistoitujen tutkimusaineistojen tilaus- ja toimitusjärjestelmä. Se otettiin käyttöön toukokuussa 2014. AILA 2.0 -versiota on lähdetty kehittämään osana Suomen Akatemian rahoittamaa Rajoja ylittävät työkalut ja palvelut (C-BOTS 2019-2024) -hanketta. Tietoarkistolle ja sen asiakkaille AILA on keskeinen ja tärkeä palvelu, jonka ylläpitäminen ja kehittäminen ovat yksi Tietoarkiston keskeisimpiä tehtäviä.

Miksi AILA 2.0 -versio kehitetään?

AILAn kehityksen taustalla olevat perusteet ja tavoitteet rakentuvat useista toisiaan tukevista näkökulmista, kuten tekninen, asiakaslähtöinen ja saavutettavuuden näkökulma.

Yhteiskunnalliset muutokset kytkeytyvät kaikkeen toimintaan yhteiskunnassamme. Digitalisaation etenemisen myötä esimerkiksi verkkosovelluskehityksen tahti on kiihtynyt, asiakkaiden tarpeet muuttuneet ja saavutettavuuden edellytykset kasvaneet. Kehittäjätiimi korostaakin, että oli havaittu tarve teknisen toimintaympäristön uudistamiselle, jotta AILA-palveluportaalia voidaan jatkossakin käyttää turvallisesti ja yhteen toimivasti.

Sen lisäksi keskeistä kehittämiselle on nyt ja jatkossa asiakaslähtöisyyden näkökulma, jossa korostuu tarve sujuvammalle ja saavutettavammalle palvelulle.

Saavutettavuudella tarkoitetaan verkkosivujen ja -sovellusten kohdalla samankaltaisia asioita kuin rakennetun ympäristön kohdalla tarkoitetaan esteettömyydellä, kuten mahdollisuutta kulkea tiloihin sujuvasti huolimatta mahdollisista henkilökohtaisista liikkumisrajoitteista.

Keskustelussamme nousi vahvasti esille yhteistyön merkitys, sillä kehittäjätiimissä ja muilla työssä mukana olleilla on laajaa osaamista eri osa-alueilta, kuten sisällöntuntemuksesta ja metadatasta sekä käyttäjänäkökulmasta.

Mitä on kehitetty?

Kehitystarpeiden selvittämisen jälkeen AILA-portaalia on lähdetty systemaattisesti uudistamaan kehittäjätiimin johdolla, yhteistyössä muun Tietoarkiston henkilöstön sekä sidosryhmien kanssa.

  1. Ailan tietoturvaa parannetaan päivittämällä salaisuuksien tiivistefunktioita vahvemmiksi ja nykyaikaisemmiksi, tiukentamalla salasanavaatimuksia ja salaisuuksienhallintaa, sekä suojaamalla hallintakäyttöliittymät verkkotasolla.
  2. Saavutettavuutta parannetaan esimerkiksi siten, että sovelluksen tekstien ja muiden elementtien koko ja värien kontrastit asetetaan sopivaksi myös näkökyvyn rajoitteet huomioiden. Lisäksi AILA 2.0 tulee olemaan käytettävissä pelkällä näppäimistön navigoinnilla. Kehitystyössä on myös huomioitu ruudunlukijoita käyttävät Ailan asiakkaat.
  3. Hakutoimintoja on parannettu tehostamalla hakutoimintoja, jonka myötä asiakkaiden on sujuvampi ja helpompi löytää haluamansa aineistot arkistosta. Alla on vertailua vanhan ja uuden Ailan hakutoiminnoista.

AILAn nykyiset hakutoiminnot mahdollistavat tarkennetun haun saatavuuden, tyypin, kielen, tutkimuksen aikaulottuvuuden sekä havaintoyksikkötyypin mukaan.

Kuva 1: Ailan nykyinen tarkennettu haku. Paina kuvaa nähdäksesi sen suurempana.

Seuraava kuvakaappaus on AILA 2.0:n tarkennetusta hausta. Uudessa Ailassa rajausvaihtoehdot ovat kehittyneet ja siinä on mahdollista rajata hakua esimerkiksi keruuvuoden mukaan.

Kuva 2: Aila 2.0:n tarkennettu haku. Paina kuvaa nähdäksesi sen suurempana.

Mitä seuraavaksi?

Aila 2.0 -kehittäjätiimi jatkaa kehittämistyötä. AILA 2.0:n valmistuttua käyttöönottovaiheeseen, kehittäjien on mahdollista päästä perehtymään tarkemmin jatkotyöstämistä vaativiin kohteisiin. Uudistuksiin voi perehtyä tulevan kirjoituksen myötä.

Seuraavassa blogipostauksessa jatketaan AIMS-hankkeen parissa, jolloin käsitellään tekoälyä Tietoarkiston näkökulmasta!

Lue blogi englanniksi.

Henna Kaartinen
projektiassistentti
etunimi.sukunimi [at] tuni.fi

27. maaliskuuta 2025

Japanilaiset hakivat Tietoarkistolta oppia laadullisten aineistojen arkistointiin

Tietoarkisto sai maaliskuun alussa kunnian toivottaa tervetulleiksi japanilaiset kollegansa, kun Japanin yhteiskuntatieteellisestä tietoarkistosta (Social Science Japan Data Archive, SSJDA) saapui vieraita Tampereelle. Päivän kestäneen vierailun aikana Nobutada Yokouchin johtama kolmen henkilön delegaatio tutustui Tietoarkiston laadullisten aineistojen arkistointikäytäntöihin.

Kuten Suomessa, myös Japanissa laadullisten aineistojen käyttö osana yhteiskuntatieteellistä tutkimusta on hyvin yleistä. Tähän asti vain kvantitatiivisia aineistoja arkistoinut SSJDA kokeekin tarpeelliseksi laajentaa arkistointipalvelunsa kattamaan myös laadulliset aineistot. Nobutada Yokouchin mielestä Tietoarkisto oli oikea paikka hakea mallia ja tietoa laadullisten aineistojen arkistointiin. Ei vähiten sen vuoksi, että useilla mittapuilla tarkasteltuna Tietoarkisto Suomessa on yksi kokeneimmista ja edistyksellisimmistä laadullisten aineistojen arkistoinnin asiantuntijoista koko Euroopassa.

Tapaamisen aluksi Tietoarkiston palvelupäällikkö Tuomas J. Alaterä esitteli vieraille Tietoarkiston historiaa, toiminnan perusperiaatteita ja tilastoja. Tämän jälkeen Tietoarkiston laadullisten aineistojen arkistoinnin asiantuntijatiimi vastasi yksityiskohtaisesti SSJDA:n ennalta lähettämiin kysymyksiin. Tietosuoja-, tutkimuseettisiin ja aineistojen käyttöoikeuksia koskeviin kysymyksiin vastasi Tietoarkiston johtava tietosuoja-asiantuntija Arja Kuula-Luumi.

Päivän päätteeksi tietoasiantuntijat Joel Kallio ja Sanni Tujunen esittelivät Tietoarkiston kehittämää laadullisten aineistojen käsittelytyökalu Kvalikristua, joka nopeuttaa laadullisten aineistojen käsittelyä. Työkalun avulla aineistotiedostoihin voidaan tehdä helposti esimerkiksi erilaisia massamuutoksia, sekä luoda aineistolle käytettävyyttä lisäävä html-hakemisto. Kvalikirstun ohella japanilaisvieraita kiinnosti myös Tietoarkiston luoma ja ylläpitämä Penna-kirjoitusaineistojen keruutyökalu, joka palvelee paitsi Tietoarkiston aineistoja kerääviä asiakkaita, myös virtaviivaistaa kirjoitusaineistojen käsittelyä arkistointivaiheessa.

Toiminnoissa paljon yhteneväisyyksiä

Vaikka tapaamisessa keskityttiin Tietoarkiston laadullisten aineistojen arkistointia koskevien käytäntöjen läpikäymiseen, esitteli myös SSJDA vierailun aikana omaa toimintaansa. Päivän aikana havaittiin, että Tietoarkistolla ja Japanin SSJDA:lla on monia yhtäläisyyksiä. Aineistojen arkistointiin liittyvät haasteet ovat hyvin samankaltaisia maasta tai maanosasta riippumatta. Molemmat arkistot osoittautuivat myös suurin piirtein saman ikäisiksi, ja aineistovarannot lähestulkoon samankokoisiksi. Lisäksi molempien arkistojen arkistointikäytännöt ovat monelta osin hyvin yhdenmukaisia. Lukuisista yhtäläisyyksistä huolimatta arkistojen toimintatavoissa ja palvelutarjonnassa huomattiin myös eroja. SSJDA esimerkiksi tarjoaa tutkijoille analyysipalveluja, toisin kuin Tietoarkisto. Tietoarkisto puolestaan tarjoaa kvantitatiivisten aineistojen kuvailujen yhteydessä kattavat muuttujakuvailut, jotka toistaiseksi puuttuvat kokonaan SSJDA:n aineistoista.

Tietoarkistossa vierailleeseen ryhmään kuului Nobu Yokouchin (2. oik.) lisäksi Kenji Ishida ja Sae Taniguchi. Tietoarkistosta osallistuivat Tuomas J. Alaterä, Jarkko Päivärinta, Arja Kuula-Luumi, Sanni Tujunen ja Joel Kallio.

Nobutada Yokouchi esitteli tietoarkistolaisille mm. SSJDA:n aineistokatalogia (JDCat) sekä tapaa, jolla SSJDA hyödyntää tekoälyä aineistokuvailujen laadinnassa. Yokouchin mukaan tekoäly näyttää pystyvän tuottamaan jo lähes yhtä hyviä aineistokuvailuja manuaalisesti tehtyjen kanssa. Tekoälyn hyödyntämismahdollisuudet aineistonkäsittelyn eri vaiheissa kiinnostavat myös Tietoarkistoa. Tietoarkistolla on juuri käynnistynyt Suomen Akatemian rahoittama AIMS-hanke, jossa muun muassa selvitetään tekoälyn hyödyntämisen mahdollisuuksia arkistotyössä. Kokemustenvaihto Japanin ja Suomen tietoarkistojen välillä tekoälyn tarjoamista mahdollisuuksista ei siis varmastikaan rajoitu vain tähän vierailuun.

Kaiken kaikkiaan vierailu oli molemmille osapuolille opettava. Oli kiinnostavaa huomata, että vaikka moni asia tehdään osittain samalla tavalla, on käytäntöjen välillä myös eroja. Uskoaksemme pystyimme tarjoamaan laadullisten aineistojen arkistointiin laajentavalle SSJDA:lle paljon arvokasta tietoa laadullisten aineistojen arkistoinnista. Jäämme mielenkiinnolla odottamaan, että SSJDA saa käynnistettyä laadullisten aineistojen arkistoinnin ja toivomme SSJDA:lle menestystä tässä työssä.

Yhteistyö arkistojen välillä jatkuu varmasti myös tulevaisuudessa. Seuraava yhteinen tilaisuus on jo tiedossa, sillä molemmat arkistot osallistuvat kesällä kansainväliseen IASSIST-konferenssiin, joka kokoaa vuosittain tutkimusaineistojen arkistoinnin asiantuntijat eri puolilta maailmaa yhteen. Tänä vuonna IASSIST järjestetään kesäkuun alussa Bristolissa Englannissa.

Lisätietoa:
» SSJDA
» JDCat
» Kvalikirstu
» Penna
» AIMS-hanke

Jarkko Päivärinta
erityisasiantuntija, kvalitatiivisten aineistojen arkistointi
etunimi.sukunimi [at] tuni.fi

17. tammikuuta 2023

Tietoarkisto monitieteisessä COVID-19-dataportaalissa

Profiilikuva Profiilikuva
Kukapa tiesi vuoden 2019 lopulla, mitä tuleman piti, kun uutiset uudesta viruksesta kantautuivat korviimme. Virus sai nimen COVID-19 ja pian olivat asiat sekaisin ympäri maailman. Uusi virus käynnisti myös monitieteisen tutkimusaallon. Dataa kerättiin, ja kerätään yhä, niin itse viruksesta ja sen aiheuttamasta sairaudesta kuin myös viruksen torjuntaan liittyvistä toimista ja toimien vaikutuksesta sekä viruksen leviämiseen että yksilöihin ja yhteiskuntaan. COVID-19-viruksen vaikutukset ovat olleet hyvin monitahoisia. Jotta niitä voitaisiin tutkia myös näin jälkikäteen, tarvitaan tietoa siitä, mitä datoja aiheesta on kerätty. Tähän tarpeeseen vastaa monitieteinen COVID-19 dataportaali.

Tietoarkistolla oli keskeinen rooli yhteiskuntatieteellisten ja humanististen tutkimusaineistojen tuomisessa osaksi COVID-19-dataportaalia. Näiden tieteenalojen ensimmäiseksi lähteeksi valikoitui CESSDAn datakatalogi, jossa on tarjolla runsaasti rikasta ja laadukasta yhteiskuntatieteellisten tutkimusaineistojen metadataa Tietoarkiston ohjelmoiman OAI-PMH rajapinnan kautta. Vaikka metatiedot ja rajapinta olivat jo valmiita, vaati metatietojen saaminen COVID-19-dataportaaliin runsaasti työtä.

Palvelun Logo. COVID-19 Data Portal

CESSDAn datakatalogi sisältää monipuolisesti erilaisia yhteiskuntatieteellisiä ja humanistisia teemoja käsittelevien aineistojen metatietoja kuten kaikki Tietoarkiston aineistojen metatiedot. Tämän vuoksi piti ensiksi valita COVID-19-dataportaaliin sopivat aineistot. Tähän tarkoitukseen otettiin käyttöön DSpace-repositoriosovellus, jonka kreikkalainen National Centre for Social Research (EKKE) asensi Barcelona Supercomputing Centerin (BSC) tarjoamalle palvelimelle. DSpace käyttää hakuihin Apache Solr -ohjelmistoa, joka tukee monenlaisia tehokkaita hakuja. EKKE haravoi DSpaceen kaiken CESSDAn datakatalogin sisältämän metadatan ja lisäsi rajapinnan, jonka avulla hakuja voi tehdä koneellisesti saaden tulokseksi linkin alkuperäiseen metadataan OAI-PMH-rajapinnassa.

Tietoarkisto sovitti CESSDAn datakatalogin DDI Codebook 2.5 -muotoisen metadatan COVID-19-dataportaalin käyttämään OmicsDI-formaattiin ja tuotti metatietojen muuntamiseen XSLT-tiedoston. Tietoarkisto kehitti sovelluksen, joka käyttää edellä mainittuja rajapintoja ja XSLT-tiedostoa, jotta valittujen aineistojen metadatat saadaan halutussa muodossa COVID-19-dataportaaliin. "Social Science & Humanities"-osion ensimmäinen versio julkaistiin COVID-19-dataportaalissa viime vuoden lokakuussa. Näitä prosesseja, hakuja ja sovelluksia kehitetään edelleen ja työn alla on myös uusien metadatalähteiden lisääminen. Seuraavana vuorossa on European University Instituten (EUI) COVID-19 Social Sciences Data Portal.

COVID-19-dataportaali on monitieteisyydessään ainutlaatuinen ikkuna pandemiaan. Tietoarkisto oli ensimmäisiä suomalaisia organisaatioita, joiden tutkimusaineistot olivat löydettävissä COVID-19-dataportaalin kautta. Arkistoimalla korona-aiheisen tutkimusaineistosi Tietoarkistoon, sinunkin datasi saa kansainvälistä näkyvyyttä COVID-19-dataportaalin kautta.

Lisätietoa:

Katja Moilanen
erityisasiantuntija

Markus Tuominen
IT-asiantuntija

etunimi.sukunimi [at] tuni.fi

3. marraskuuta 2022

Let’s Keep It FAIR

The acronym FAIR cannot be avoided when talking about research data. And that’s good. FAIR stands for better discoverable and accessible research data, documented and published in a way that makes it reusable and understandable by both humans and machines. At least those are the benefits. Viewed from the repository world and with digital preservation glasses on, FAIR research data should also be curated data that have found a home in a repository where the designated user community knows to look for it. This can be greatly facilitated by improving the repository's ability to produce and preserve FAIR (meta)data.

During the last three years, FSD has led the work in the EOSC-Nordic project's work package on FAIR and repository certification support. In addition to sound digital preservation practices, we found that rich, standards-based metadata, documented processes, and a clear mission in digital preservation are essential to keeping data FAIR. Money also helps, but it cannot buy love or eternal existence if expertise is lacking. Therefore, improving the repository's ability to produce and preserve (meta)data is one key step towards FAIRer and more trusted data sharing.

Landscaping the Nordic countries and the Baltics

To better understand the Nordic and Baltic research data repository landscape, the working group conducted a desk study to examine the characteristics of the data repositories in the region. This was done using publicly available information on 86 repository websites. A significant majority were specialist repositories focused on specific fields or disciplines, while the rest were generalist repositories.

We were interested in what information about the repository itself was easily accessible to users and other stakeholders because conveying trust is crucial. We were looking for information that is essential for understanding the services and reusing data: mission statement, description of the designated community, methods of data preservation, model citations, use of PIDs and terms of use.

Almost three out of four repositories had a mission statement and about half of them had a description of the designated community. Almost half specifically mentioned being responsible for long-term preservation. A little more than half provided a model citation for their data. Over three fourths had the terms of data use available on their websites. The content and scope varied between repositories.

Common repository registries, such as re3data and FAIRsharing, help users find suitable repositories and provide an overview of existing services. As many as 72% of the repositories in our sample had a record in re3data, while only 22% had a record in FAIRsharing. All repositories that had a FAIRsharing record also had a re3data record. This suggests that currently re3data is considered the most important registry for repository information.

Repository certification

We are also looking for information about the repository certifications. Only 17 (20%) of the repositories mentioned certification on their website. The most common certificate was CoreTrustSeal (CTS). Other certificates mentioned were the CLARIN certificate, ISO 27001 and WDS. Currently, there are relatively few CTS-certified repositories in the Nordic countries and the Baltics compared to Western Europe. Support and training for CoreTrustSeal self-assessments offered during the EOSC-Nordic project is expected to pump the number of certified repositories from ten to 15 or 16.

Although the certification alone does not preserve a single byte, it seems that support, networking, and awareness raising over the past couple of years in the EOSC-Nordic project have helped the players in their game to keep the data FAIR.

---

This blog entry is partially based on the final report of the work package. Deliverable D4.5 Report on completed FAIR data standard adoption and certifications of data repositories in the region is forthcoming.

Today is the World Digital Preservation Day. Follow what's happening around the world!

More information:
» World Digital Preservation Day
» World Digital Preservation Day Events Calendar
» EOSC-Nordic Knowledge Hub (Final report will be here when published)

Tuomas J. Alaterä
Senior Specialist (Web Services, Digital Preservation and Communications)
firstname.surname [at] tuni.fi

17. maaliskuuta 2022

Kaksi vuotta koronaa mullisti tietoarkistotyön

Maaliskuun 13. vuonna 2020 on varmasti perjantai, jonka tietoarkistolaiset muistavat pitkään. Se oli viimeinen päivä toimistolla ennen etätyöjaksoa. Tuolloin emme voineet tietää, että kotikonttoreilla oltaisiin lähes jatkuvasti seuraavat pari vuotta. "Palasimme" lähityöhön maaliskuun toisella viikolla, mutta korona on muuttanut työelämäämme pysyvästi, väitän.

Suuri osa tietoarkistolaisista haluaa työskennellä jatkossakin pääasiassa etänä. Jo puolet on tehnyt hybridisopimuksen, jossa etänä ollaan enintään 16 päivää kuukaudessa. Tietoarkiston tiloihin meitä houkuttelee kollegoiden kohtaaminen ja yhteinen ideointi. Joillekuille työpisteen ergonomia on suurin syy matkustaa Tietoarkistoon. Työnteon vanhakantainen paikkasidonnaisuus on historiaa digitalisoituneessa työympäristössä, ja se on hyvä asia.

Työn ja työyhteisön monipaikkaisuus vaatii totuttelemista. Johtajana pohdin sitä, miten ylläpitäisimme ja säilyttäisimme yhteishengen ja yhteisen tekemisen tavat, jotka olivat yksi Tietoarkiston vahvuus ennen poikkeustilaa. En koe, että henki olisi oleellisesti muuttunut, eikä viitteitä muutoksesta näy myöskään työhyvinvointia mittaavissa kyselyissä. Riski lienee olemassa. Etenkin työsuhteen alussa työyhteisöön sisään pääseminen vaatii kohtaamista ja esihenkilöiltä myös ihmisten erilaisuuden havaitsemista ja hyväksymistä.

Omassa ja monen muunkin tietoarkistolaisen työarjessa viimeiset kaksi vuotta on ollut hyvin intensiivistä etäyhteistyötä kansainvälisten kumppanien kanssa. Siitä valtaosa oli hoitunut virtuaalisesti jo ennen koronakautta, mutta yhtä lailla kansainvälisessä kanssakäymisessäkin tarvitaan tapaamisia, joissa kokousten kahvitauolla tai lounaalla keskustellaan vapaammin ja kysellään lisätietoja epävirallisemmin. Kohtaamisia ja yhteistä ideointia kaivataan siis tälläkin saralla.

Sama pätee kansalliseen yhteistyöhön ehkä vielä enemmän. Tuntuu että kotimaassa monet yhteistyösuunnitelmat ja tapahtumat ovat olleet tauolla, odottamassa sitä, että taas saa ja uskaltaa matkustaa ja kokoontua. Omaan kalenteriini näitä on nyt alkanut varovasti putkahdella. Aika näyttää, miten suurelta osin kotimaiset kokoukset ja tapahtumat jäävät virtuaaliseen moodiin. Vapaamuotoista tietojen ja näkemysten vaihtoa tarvitaan, eikä se aina etänä luonnistu.

Mikä se mullistus tietoarkistotyössä siis on? Perustyötä tehdään hyvin samoilla menetelmillä koronasta riippumatta. Mullistus on paikkasidonnaisuudesta luopuminen. Tämä vaatii erilaista suunnitelmallisuutta, kuin mihin on totuttu ennen koronaa ja koronan aikana. Sitä pitää opetella ja siitä pitää kouluttaa. Hybridistä tulee varmasti keskeinen toimistotyön kehittämiskohde, ellei se sitä jo olekin.

Kuva: Max Pixel (CC0)

Helena Laaksonen
johtaja
etunimi.sukunimi [at] tuni.fi

18. helmikuuta 2022

Viittaa dataan - myös omaan dataasi!

Dataviittauksen tiekartan julkaisemisesta on kulunut jo muutama vuosi. Tavoitteena oli tehdä dataan viittaamisesta osa suomalaista julkaisukäytäntöä. Suosituksena oli ja on sekä ihmislukijalle että koneelle ymmärrettävien dataviittausten käyttäminen. Tutkimusaineistoihin viitataan kuitenkin edelleen hyvin vaihtelevasti ja usein ei ollenkaan.

Olen selaillut havaintoni todentamiseksi hyvin sattumanvaraisesti Tietoarkistolle keskeisten tieteenalojen lehtiä. En siis osaa sanoa, miten asia toteutuu jollakin muulla tieteenalalla enkä väitä, että kukaan ei koskaan viittaa. Joissakin tapauksissa tutkimusaineistoon viittaaminen on peräti esimerkillistä.

Tietoarkisto on jo pitkään ohjeistanut seikkaperäisesti, miten tutkimusaineistoon voi viitata tieteellisessä tekstissä. Malliviittaukset ovat olleet aina saatavilla aineiston kuvailutietojen osana. Vuosien saatossa olemme muuttaneet kielenkäyttöä asiakasystävälliseen suuntaan, ja viittausvaatimuksen rinnakkaisterminä on nykyisin käytössä malliviittaus. Käytettyyn aineistoon viittaaminen on silti yksi käyttöehto, johon asiakas sitoutuu ladatessaan aineiston. Malliviittaus on saatavilla aineiston lataussivulla ja tarkempaan viittausohjeeseen pääsee sen yhteyteen sijoitetusta linkistä.

Toinen havaintoni vaatisi enemmän selvittelyä, mutta mututuntumani on, että toisen tutkijan aineistoon viitataan (tavalla tai toisella) useimmiten. Sen sijaan omaan aineistoon viittaaminen ei ole yleinen käytäntö. Omaan dataan ei viitata välttämättä edes silloin, kun aineisto on jo Tietoarkistossa (tai jossain tallennuspalvelussa) ja viittaus olisi kohtuullisen helppo kopioida suoraan artikkelin lähteisiin. Tietoarkistoon tallennettuun aineistoon voi viitata myös silloin, kun sen arkistointiprosessi ei ole valmis. Toisin sanoen aineistolle voi saada pysyvän tunnisteen ja niin sanotun alustavan aineistonimen. Suunnitelmissamme on myös tekijöiden tutkijatunnisteiden (ORDIC) hyödyntäminen.

Tiivistetysti saat Tietoarkistosta seuraavat "viittauspalvelut":

4. toukokuuta 2021

Arkistoidut aineistot tukevat tutkimuksen toistettavuutta

Toistettavuus on tieteellisen tutkimuksen perusperiaatteita. Se tarkoittaa, että tutkija itse tai hänestä riippumaton taho kykenee toistamaan kokeen tai tutkimuksen. Näin voidaan selvittää, kuinka tutkimustuloksiin on päädytty, onko kokeessa mahdollisesti virheitä tai koetuloksissa satunnaisvaihtelua, ja edistää siten tutkimuksen luotettavuutta ja läpinäkyvyyttä.

CSC järjesti 23. huhtikuuta webinaarin, jossa käsiteltiin tutkimuksen toistettavuutta eri näkökulmista sekä esiteltiin toistettavuutta edistäviä työkaluja.

Toistettavuus edellyttää, että tutkimuksen vaiheista on saatavilla tarpeeksi tietoa. Lisäksi tutkimusaineiston on oltava myös muiden kuin alkuperäisen tutkijan saatavilla. Hyvä aineistonhallinta onkin keskeisessä osassa toistettavuuden edistämisessä. Mitä paremmin aineiston keruu ja muokkaaminen sekä sen analysointiin käytetyt menetelmät, ohjelmistot ja ohjelmistoympäristöt on dokumentoitu, sitä helpompi tutkimus on toistaa. FAIR-periaatteiden (löydettävyys, saavutettavuus, yhteentoimivuus ja uudelleenkäytettävyys) soveltaminen tutkimuksen koko elinkaaren ajan edistää tutkimuksen toistettavuutta.

Tutkimuksen toistettavuutta tukee myös aineiston arkistoiminen luotettuun, pitkäaikaissäilytykseen erikoistuneeseen ja jatkokäytön mahdollistavaan arkistoon. Tietoarkisto edistää ihmistieteiden aineistojen saatavuutta ja löydettävyyttä tarkistamalla arkistoitavat aineistot yksityiskohtaisesti, kuvailemalla aineistot ja niihin tehdyt muutokset yksityiskohtaisesti ja kontrolloituja sanastoja käyttämällä, tarjoamalla aineistojen metatiedot avoimesti CC BY 4.0 -lisenssillä ja antamalla aineistoille pysyvät tunnisteet.

Data Stewards by The Turing Way Community, & Scriberia. CC BY 4.0

Nämä kaikki edistävät FAIR-periaatteiden toteutumista. Periaatteet edellyttävät myös metatiedon koneluettavuutta. Tietoarkiston aineistokuvailut ovatkin saatavissa myös ohjelmallisten rajapintojen kautta.

Hyödyntämällä arkistoitua aineistoa tutkimuksessaan tutkija voi luottaa siihen, että tutkimusaineisto on tiedeyhteisön saatavilla kattavasti dokumentoituna. Tutkija säästää aikaa ja vaivaa, ja voi keskittyä dokumentoimaan aineiston käsittelyyn, menetelmällisiin valintoihin ja tuloksiin liittyviä asioita.

Anonymisointi voi muodostua haasteeksi toistettavuudelle

Webinaarissa käsiteltiin toistettavuutta yleisesti ja hiukkasfysiikan tapausesimerkin kautta. Toistettavuuden periaate pätee kaikilla tieteenaloilla, mutta ihmistieteissä tunnisteellisten tutkimusaineistojen anonymisointi luo omat haasteensa aineiston jatkokäytölle ja tutkimuksen toistettavuudelle.

Sensitiivisestä ja tunnisteellisesta aineistosta on usein tarpeen karkeistaa tai poistaa suoria tai epäsuoria tunnisteita. Jatkokäyttöön tulevalla aineistolla ei välttämättä voi toteuttaa alkuperäisten tutkijoiden tekemiä analyysejä sellaisenaan.

Hyvin ja ajoissa suunniteltu aineistonhallinta auttaa tässäkin: kun tutkittavilta kerätyt henkilötiedot on minimoitu ja heitä on informoitu aineiston jatkokäytöstä, aineisto voidaan arkistoida mahdollisimman vähin muutoksin.

Ihanteellisessa tapauksessa tutkimusaineisto on avoimesti tiedeyhteisön saatavilla tulosten koettelemiseksi, mutta joskus aineistoa ei voi avata edes rajoitetusti. Syitä voivat olla esimerkiksi siihen sisältyvät tunnisteet, aineiston arkaluonteisuus, tai että aineisto sisältää liiketoiminnan kannalta salassa pidettävää sisältöä. FAIR-periaatteiden noudattaminen ei edellytäkään aineiston avointa saatavuutta, vaan itse aineisto voi olla rajoitettua tai jopa kokonaan salattua. Periaatteiden mukaista sen sijaan on, että rajoitetusta tai salatusta aineistosta on saatavissa metatietoa, joka kuvaa sen rakennetta, kohdetta, keruutapaa, sovellettuja menetelmiä ja malleja sekä hallinnointia tutkimusprojektin aikana.

Tutkimuksen ja aineistosta tehtyjen johtopäätösten läpinäkyvyyden kannalta on suositeltavaa avata aineistosta vähintään kattavat kuvailutiedot, kuin säilyttää kaikki tiedot muun tiedeyhteisön tai yhteiskunnan ulottumattomissa.

Lisätietoa:

» CSC:n webinaari 23.4.2021: Mitä tutkimuksen toistettavuus tarkoittaa?

» Aineistonhallinnan käsikirja

Data Stewards -kuva (2020, March 3). Illustrations from the Turing Way book dashes. Zenodo. http://doi.org/10.5281/zenodo.4323154

Henri Ala-Lahti
tietoasiantuntija

Tuomas J. Alaterä
erityisasiantuntija

etunimi.sukunimi [at] tuni.fi

23. maaliskuuta 2021

Palveluita tutkimuksen tueksi kehitetään hankeyhteistyöllä

Tietoarkisto osallistuu jatkuvasti useisiin erilaisiin kehityshankkeisiin. Hankkeissa kehitetään nykyisiä palveluita ja suunnitellaan uusia tutkijoille sekä tutkimuksen tueksi. Hanketyössä pyritään löytämään ratkaisuja eri toimijoiden yhteisiin tarpeisiin. Eurooppalaisten yhteiskuntatieteellisten tietoarkistojen tutkimusinfrastruktuuri CESSDAn palveluntuottajana Tietoarkisto osallistuu aktiivisesti sen moniin työryhmiin ja projekteihin. Lisäksi Tietoarkisto tekee yhteistyötä muiden kansainvälisten ja kansallisten tahojen kanssa.

Monet tietoarkistolaiset osallistuvat hankkeisiin eri tavoin. Hanketyö on arkipäivää erityisesti Projektit ja kehittäminen -moduulin jäsenille, joiden työajasta suurin osa kuluu hanketehtävien parissa. Kehittämispäällikkö Mari Kleemola ja erityisasiantuntija Taina Jääskeläinen kertovat hanketyön arjesta sekä kuulumisia hankkeista, joihin he osallistuvat.

Mihin hankkeisiin osallistut ja mitä niissä tehdään?

Mari: Osallistun SSHOC- (Social Sciences & Humanities Open Cloud) ja EOSC Nordic (European Open Science Cloud) -hankkeisiin sekä CESSDAn Trust-projektiin. Lisäksi toimin CESSDAn Tools-työryhmän vetäjänä.

– Näillä hankkeilla on rinnakkaisia tehtäviä, joilla on synergiaetuja. Esimerkiksi SSHOC- ja CESSDA Trust -hankkeissa edistetään luotettujen aineistovarantojen sertifiointia tukemalla data-arkistoja sähköisten aineistojen luotettavassa säilytyksessä ja laadun takaamisessa. Olen CoreTrustSeal-sertifikaatin johtokunnan jäsen ja minulle on kertynyt sertifiointiin liittyvää asiantuntemusta, jota voin tuoda hankkeisiin. Hankkeista puolestaan saadaan palautetta, jota voidaan käyttää sertifioinnin ja data-arkistojen kehittämisessä.

– EOSC Nordic ja SSHOC -projekteissa sekä Tools-työryhmässä kehitetään myös uusia palveluita ja parannetaan aineistojen ja niiden kuvailutietojen yhteentoimivuutta. Kaikilla hankkeilla on yhteisenä tavoitteena Euroopan avoimen tieteen pilvipalvelun eli EOSCin rakentaminen.

Taina: Yli puolet työajastani kuluu CESSDAn hankkeisiin. Toimin sekä CESSDAn aineistoluettelon että sanastopalvelun sisältövastaavana. Rooliin kuuluu ohjausryhmän vetäminen, käyttäjien edustaminen, vaatimusmäärittely, yhteistyö teknisen puolen vastuuhenkilöiden kanssa, tiedottaminen, sidosryhmäyhteistyö ja monenlainen toiminnan sujuvuuden varmistaminen. Lisäksi osallistun monikielisen ELSST-asiasanaston (European Language Social Science Thesaurus) sisällön kehittämiseen ja koulutan kaikki sen kääntäjät.

– CESSDAn aineistoluettelossa on 15 kansallisen palveluntuottajan julkaisemat tutkimusaineistokuvailut, joita on tällä hetkellä yli 30 000. Se on erinomainen lähde löytää yhteiskuntatieteellisiä ja joitakin terveystieteellisiä tutkimusaineistoja eri maista. Luettelosta on julkaistu uusi versio viime kuussa.

– CESSDAn sanastopalvelussa luodaan, ylläpidetään ja käännetään monikansalliseen käyttöön tarkoitettuja sanastoja. Monet sanastoista on luotu DDI Allianssin tutkimusaineistojen kansainvälisen kuvailustandardin osaksi, ja osallistun sen sanastoryhmän työhön itsekin. CESSDAn jäsenorganisaatiot kääntävät näitä omille kansallisille kielilleen.

– Näiden lisäksi osallistun kahteen EU-projektiin: TRIPLE (Transforming Research through Innovative Practices for Linked Interdisciplinary Exploration)- ja SSHOC-projekteihin. Molemmissa on samoja elementtejä kuin CESSDA-hankkeissa, mutta nämä koskevat useampaa eurooppalaista tutkimusinfrastruktuuria ja tieteenalaa, kuten kielitieteitä ja humanistisia tieteitä. Kummassakin projektissa olen yhden työpaketin jäsenenä, useimmiten liittyen sanastoihin, niiden hyödyntämiseen tai laajoihin aineistoluetteloihin. TRIPLEssä kiinnostaa erityisesti nähdä, missä määrin algoritmeilla onnistutaan rikastuttamaan eri maista ja eri kielillä tulevaa metadataa.

Mikä hanketyössä on antoisinta?

Mari: Hanketyössä oppii paljon uutta eikä siinä ole kahta samanlaista päivää. Se avaa näköaloja Eurooppaan ja muualle maailmaan ja tarjoaa tilaisuuden nähdä, mitä muualla tehdään ja miten. Hankkeiden kautta voimme myös vaikuttaa siihen, että Suomen avoimen tieteen hyviä käytäntöjä omaksuttaisiin kansainvälisesti. On myös antoisaa olla osaltani vaikuttamassa alan kehitykseen ja rakentamassa CESSDAa ja sen palveluita yhteiskuntatieteilijöille.

Taina: Olen viihtynyt toimiessani ja verkostoituessani eri maista tulevien ihmisten kanssa. On mielekästä tehdä työtä, jossa voi kerrankin hyödyntää kaikkia asiantuntemusalueitaan. Olen taustaltani sekä informaatikko että kielenkääntäjä, joten metadatan harmonisointi ylikielirajojen ja datan löydettävyys kiinnostavat minua aina. Vuosikausien kieliharrastuksestani on ollut yllättävän paljon iloa, koska huomasin voivani tutkailla sanastoja tai aineistokuvailuja kahdeksalla eri kielellä ja pysyä suunnilleen kärryillä siitä, onko siellä vääriä tietoja väärässä paikassa jne. Taidan olla kansainvälisessä työskentelyssä kuin kala vedessä.

– Antoisaa on huomata, että on pystynyt organisoimaan asioita niin, että tavoitteet saavutetaan ja maaliin päästään, vaikka olisi tullut kuinka monta yllättävää mutkaa matkan varrella. Koko ajan saa myös oppia uutta eikä tylsää päivää ole.

Entä mikä on haastavinta?

Mari: Haastavaa on se, että kansainvälisessä hanketyössä tehdään enimmäkseen virtuaalisesti tiimityötä eri taustoista tulevien ihmisten kanssa. Se vaatii erilaisten näkökulmien, tieteenalakäytäntöjen ja ihmisten työtapojen huomioon ottamista ja yhteensovittamista. Monesti tapaaminen ja tutustuminen edes kerran kasvokkain helpottaa yhteistyötä.

Taina: Kun kehitetään kansainvälisiä palveluja, tavoitteesta ollaan usein yksimielisiä mutta matkan varrella joudutaan neuvottelemaan siitä, miten tavoitteisiin parhaiten päästään. Data-arkistot ovat keskenään hyvin erilaisia: osa hyvin resursoituja ja osa vähemmän, osa toiminut vuosikymmeniä, osa on toiminnan alkutaipaleella. Tämä asettaa omat haasteensa esim. metadatan harmonisoinnissa.

– Käyttäjien edustajien ja IT-puolen on myös hyvä jatkuvasti keskustella siitä, paljonko kukin käyttäjien toive vaatii koodauspuolella. Joskus haluttu toiminnallisuus on helposti toteutettavissa ja joskus se vaatii runsaasti työtä. Jälkimmäisessä tapauksessa käyttäjien edustajien on pohdittava, onko se vaivan arvoista. Tärkeintä olisi tunnistaa ja jättää pois paljon IT-työtä vaativat vähemmän tärkeät tavoitteet, jotta voidaan keskittyä olennaisempiin.

– Sisältövastaava on tietyissä asioissa vahtikoira, joka tarkkailee mm. metadatan laatua ja yhteensopivuutta CESSDAn aineistoluettelon ja sanastojen vaatimusten kanssa. Tehtävässä täytyy neuvotella eri maissa sijaitsevien organisaatioiden kanssa heidän metadatansa laadusta ja yhteensopivuudesta sekä hoputtaa esim. sanastojen kääntäjiä tekemään oma kieliversionsa ajoissa. Ystävällisistä reaktioista päätellen ratkaisuja etsivää vahtikoiratoimintaani ei kuitenkaan ole koettu ikäväksi.

Kuinka koronavuoden poikkeusolot ovat vaikuttaneet hanketyöskentelyyn?

Mari: Ehdin onneksi tavata suurimman osan tämänhetkisten hankkeiden yhteistyökumppaneista ennen poikkeusolojen alkua, joten yhteistyö sujuu hyvin myös virtuaalisesti. Kasvokkaisten tapaamisten puuttuessa vapaamuotoinen ideointi on kuitenkin hankalampaa. Kasvokkaisissa kokouksissa epävirallisella sosiaalisella kanssakäymisellä on suuri merkitys - työtä tehdään ihmisten kanssa ja välillä on hyvä jutella heidän kanssaan muustakin kuin työasioista!

Taina: Normaalioloissakin kansainväliset projektit tarkoittavat sähköposteja ja videokonferensseja, joten siihen koronavuosi ei ole tuonut muutosta. Zoom oli kovassa käytössä jo aiemmin. Esimerkiksi aineistoluettelon uuden version teknisen puolen tekijät olivat Iso-Britanniassa ja Norjassa, sanastotyökalun koodari puolestaan Saksassa.

– Ainoa mikä on jäänyt pois, ovat kasvokkaiset tapaamiset ja konferenssit. Niitä kaipaa ja olisi hyvä välillä olla, vaikka en lentokentillä notkumisesta ja muusta matkustamisen aikasyöpöistä pidä. Verkostoituminen on paljon helpompaa, kun ihmiset on tavannut kasvotusten. Monet asiat saa helpommin ja nopeammin selvitettyä paikan päällä ja tauoilla. Jos projektissa on paljon ihmisiä, joita on aina tavannut vain etänä, on toiminnan sujuvuudessa ja verkostoitumisessa eroa verrattuna siihen, että ryhmä olisi ainakin kerran tavannut kasvotusten.

– Etätyön huonoin puoli on työpäivien venyminen, koska tekemistä tuntuu aina riittävän loputtomiin.

Lisätietoa:

» Tietoarkiston hankesivut
» Kehittämispäällikkö Mari Kleemola
» Erityisasiantuntija Taina Jääskeläinen

Henri Ala-Lahti
tietoasiantuntija
etunimi.sukunimi [at] tuni.fi

5. marraskuuta 2020

Tutkimusdata on pysyvän tunnisteensa ansainnut

Tänään on maailmanlaajuinen digitaalisen pitkäaikaissäilyttämisen päivä. Miksi siis kirjoittaa pysyvistä tunnisteista, PIDeistä? Siksi, että tunnisteen merkitys on keskeinen laadukkaan pitkäaikaissäilytyspalvelun toteuttamisessa. Kuten tutkimusjulkaisu, myös tutkimusdata on laajasti hyödyllinen vain, jos se on löydettävissä ja kuvailtu riittävän yksityiskohtaisesti. Pysyvä tunniste onkin oleellinen osa pyrkimystä löydettävämpään, saavutettavampaan, yhteentoimivampaan ja uudelleenkäytettävämpään – siis FAIRimpaan – dataan. Se edistää myös avointa tiedettä ja tutkimusta.

Jos tutkimus olisi aina ollut digitaalista, PID (Persistent Identifier) olisi varmasti jo tutkimusdatan normaali kumppani, samoin kuin julkaisuille jo pitkään annetut kirjastoluokitukset ja teoksen identifioiva merkkijono. Tunnisteen avulla digitaalinen aineistopaketti on yksiselitteisesti identifioitavissa ja viitattavissa. Pääsääntöisesti oletamme, että data on saatavissa "verkosta". Vielä toistaiseksi datan löytäminen tai tiettyyn dataan viittaaminen vaatii usein nojautumista muuttuviin URL-osoitteisiin tai viittaamista hakutuloksiin tietokannasta.

PID on avain. Se tunnistaa ja avaa laatikon, josta löytyy itse datan ohella sen kuvaus, ja kenties joukko versioita tai tietoja siitä, mitä versiota tai mitä osaa datasta on hyödynnetty. PID yksistään ei tietysti takaa kaikkea tätä. Mutta PIDillä on omistaja, jolla on velvollisuus taata tunnisteen toimivuus, ainutkertaisuus ja pysyvyys - ja siten datan löydettävyys. Siksi pysyvää tunnistetta ei tulisi koskaan saada aineistolle, jonka metatiedosta, saatavuudesta tai säilyttämisestä ei ole huolehdittu.

PID on käypää valuuttaa. Sillä on käyttöarvo ja tunnisteiden hallinta pitää arvoa yllä. Ylläpitäjä, korkeakoulu, kirjasto tai data-arkisto, vastaa siitä, että tunniste resolvoituu oikeaan lähteeseen. Pitkäaikaissäilytyksen kannalta tämä tarkoittaa, että tiedetään, mikä versio ja millä tunnisteella, on milloinkin säilytetty.

PID lisää luotettavuutta. Kaikki pysyvät tunnistejärjestelmät vaativat, että tunnisteita hallinnoidaan aina siitä alkaen, kun tunniste annetaan. Vaikka aineisto myöhemmin syystä tai toisesta hävitettäisiin tai sen saatavuutta rajoitettaisiin, PID johtaa kyselijän edelleen aineiston perustietoihin. Näin pitkä sitoutuminen aineiston ja sen tietojen ylläpitoon ei voi jäädä tutkijan vastuulle, vaan taustalla tulee olla jokin luetettava taho – esimerkiksi data-arkisto. PIDin tulee lisätä luottamusta siihen, että aineisto on luotettavasti säilytetty ja sen saatavuudesta on huolehdittu. PID kertoo, että datastasi välitetään.

PID parantaa yhteentoimivuutta. Nykypäivänä tiedon on liikuttava tietojärjestelmästä toiseen. Kun pysyvä tunniste on dokumentoitu kuvailevaan metadataan koneluettavassa muodossa, haravoituu se erilaisiin yhteysluetteloihin tai julkaisuarkistoihin osana dataviittausta. Siten PID edistää meriitin syntymistä datan tuottajille. Yhtä lailla tutkimusorganisaatiot, julkaisijat tai julkaisutiedon kerääjät voivat hyödyntää tunnistetta dataan kohdistuvien viittausten kokoamiseen. Rahoittajille tunniste tarjoaa mahdollisuuden esimerkiksi automatisoida rahoittamiensa tutkimustuotosten seuraamista.

PIDit Tietoarkistossa

Tietoarkisto antaa kullekin arkistoitavalle datalle pysyvän tunnisteen. Me käytämme URN-tunnisteita. Olemme valinneet käytännöksi, että tunniste muodostetaan aineistolle annettavan aineistonumeron perustalle, joten ihminenkin näkee, mihin aineistoon tunniste viittaa. Tämä helpottaa tunnisteen käsittelyä ja ymmärtämistä esim. tutkimusjulkaisussa, mutta on silti täysin koneluettava. Kukin aineisto saa pysyvän tunnisteensa jo siinä vaiheessa, kun sen arkistointi aloitetaan. Siten viitteen keräämäänsä (tai käyttämäänsä) aineistoon voi liittää julkaisuun jo etukäteen. Aluksi tunniste johtaa tietoon siitä, että kyseinen aineisto on arkistointiprosessissa. Myöhemmin, kun arkistointi on valmistunut ja aineisto on saatavissa, sama viite tulee ohjaamaan dataan tai sen versiohistoriaan.
PID - tunnista, mitä avaat!

Lisätietoa:

» PID linkkinä resolvoituu aineistokuvaukseen Ailassa: urn:nbn:fi:fsd:T-FSD3424
» Näin Tietoarkisto palvelee arkistoinnissa
» World Digital Preservation Day

Tuomas J. Alaterä
IT-palveluasiantuntija
etunimi.sukunimi [at] tuni.fi

21. syyskuuta 2020

ISSP 20 vuotta Suomessa - kurkistus aineistonkeruun toteutukseen

Annika Valaranta
International Social Survey Programme eli ISSP-aineistosarjaa on kerätty Suomessa jo vuodesta 2000 lähtien. Nyt syksyllä kerättävän aineiston teema on ympäristö - sama, jolla 20 vuotta sitten aloitimme. Tämän kunniaksi valotamme hieman, mitä kansainvälisen aineiston keruuprosessi vaatii, jotta kerättävä data on harmonisoitavissa eli yhdistettävissä ja ymmärrettävissä muissa maissa kerättävän datan kanssa.

Tietoarkiston kokenut ISSP-aineistojen käsittelijä Seppo Antikainen jäi eläkkeelle keväällä ja tällä kirjoituksella haluamme myös antaa tunnustusta ja kiittää häntä sarjan eteen tehdystä työstä. Kiitos Seppo!

ISSP-aineiston keruu Suomessa

ISSP:n logo
ISSP-konsortio kerää maailmanlaajuisesti yhteiskuntatieteellistä dataa. Suomessa ISSP-työryhmässä ovat vastaavat tutkijat Harri Melin ja Sami Borg sekä Tietoarkiston ja Tilastokeskuksen kääntämisen, aineistonkäsittelyn ja -keruun asiantuntijat. Tietoarkisto luovuttaa Tilastokeskuksen keräämän ISSP-datan harmonisoinnista vastaavalle Saksan Gesis-arkistolle.

ISSP:ssä tutkittavat aiheet vaihtuvat vuosittain, mutta sama teema toistuu keruissa säännöllisesti, mikä mahdollistaa pitkittäisvertailun. Aiheina ovat olleet muun muassa sosiaaliset verkostot, eriarvoisuus, perhe- ja sukupuoliroolit, työ, uskonto, vapaa-aika ja urheilu sekä ympäristö. Kansainvälinen harmonisoitu data on saatavilla Gesisistä, mutta Suomen kyselyt myös Tietoarkistosta.

ISSP-prosessi alkaa uuden lomakkeen kääntämisellä

Keruuprosessi alkaa joka vuosi vuoden vaihteessa, jolloin Saksasta ISSP-tiimi lähettää osallistuville maille kyselylomakkeen kommentoitavaksi. Sen perusteella muotoutuu lopullinen kyselylomake. Kyselyn kysymykset ovat jaettavissa kolmeen ryhmään: taustamuuttujiin, vanhoihin sisältökysymyksiin ja uusiin kysymyksiin. Kun lopullinen englanninkielinen lomake on valmis, Tietoarkisto kääntää uudet kysymykset ja tarkistaa, pitääkö vanhoja kysymyksiä päivittää ja onko taustamuuttujiin tullut muutoksia. Vahva pääsääntö on, ettei jo aiemmin kysyttyjä kysymyksiä muuteta, sillä uusi kysymyksenasettelu voi estää aiheen pitkittäistarkastelun kokonaan. Kuitenkin pieniä viilauksia on tehty: esimerkiksi ennen käytetty teitittely on muutettu nykyään sinutteluksi.

Kuvituskuva: Karttapallo
Uusien kysymysten kääntäminen suomeksi englanninkielisestä pohjalomakkeesta on tarkkaa työtä, sillä kysymysten tulee olla ymmärrettävissä suomalaisessa kontekstissa. Kun lopulta kansainvälinen data yhdistetään Gesisissä, tulee kysymysten mitata samaa asiaa. Esimerkiksi vuoden 2020 kyselyssä kääntäjät kokivat hankalaksi kääntää lauseen: How willing would you be to accept a reduction in the size of [country's] protected nature areas, in order to open them up for economic development? Suomen kielessä ei ole suoraa vastinetta termille "economic development", joka viittaa monenlaiseen eri taloudelliseen kehitykseen (esim. louhinta, kaavoitus, hakkuut). Lopullisen voiton käännöksessä vei kuitenkin yksinkertainen versio "taloudellinen hyödyntäminen" sujuvan luettavuuden vuoksi. Lopullinen kysymys on Kuinka halukas olisit supistamaan Suomen luonnonsuojelualueiden kokoa, jotta niitä voitaisiin ryhtyä hyödyntämään taloudellisesti?

Datojen kanssa pilkunviilaus on sallittua

Kun Tietoarkisto on keväällä saanut kyseisen vuoden kyselyn käännettyä suomeksi, se lähetetään Tilastokeskukseen, joka tekee lopulliset lomakkeet. ISSP-kyselyyn voi vastata niin verkossa kuin paperisella lomakkeella. Tämä tarkoittaa useaa tarkistusta ennen lopullista Tilastokeskuksen syksyllä tekemää keruuta. Ensin tarkistetaan Tilastokeskuksen suomenkielinen ja käännetty ruotsinkielinen lomake. Sitten tarkistetaan molempien kielten internetkyselyt, joiden pitää vastata täysin paperilomakkeita. Myös tutkittavien informoinnit tulee kääntää ja tarkistaa.

Datojen parissa työskentelyssä tarkkuutta ja tarkistamista ei voi ylikorostaa. Tarkistamisessa kiinnitetään huomiota siihen, että lomakkeissa kysytään kaikki pakolliset kysymykset, kysymysten vastausvaihtoehdot ovat samat ja että niiden määrä vastaa alkuperäistä englanninkielistä kyselylomaketta.

Datan valmistuminen jatkokäyttöön

Tilastokeskus lähettää keruun valmistuttua datan Tietoarkistoon prosessoitavaksi aineistoportaali Ailaa varten. Suomenkielinen data on saatavissa Ailasta usein jo maaliskuussa, siis noin puolen vuoden kuluttua keruusta. Tuore kysely pääsee heti tutkijoiden ja opiskelijoiden tarkasteluun.

Lisäksi Tietoarkisto käsittelee datasta kansainvälisen version lähetettäväksi Gesisille. Käsittely varmistaa aineiston yhdistettävyyden muiden maiden datojen kanssa. Yksityiskohtaiset ohjeet käsittelyyn, kuten miten muuttujat ja selitteet nimetään, tulevat Gesisiltä. Kansainvälinen data eroaa Ailasta ladattavasta aineistosta esimerkiksi muuttujien numeroinnissa. Lisäksi datassa ei saa olla yhtään puuttuvaa tietoa, jolla ei ole selitettä. Luovutettavaan dataan lisätään myös useita uusia muuttujia, kuten muiden maiden vastauksien kanssa yhteensopiva uskontokuntamuuttuja.

Gesisille tulee lähettää myös tarkat tiedot aineistonkeruusta ja siitä, miten muuttujat on koodattu. Pienimmätkin muutokset, kuten yksittäisen sanan yksikkömuotojen muutos monikkoon, kirjataan ylös. Tällä kaikella työllä halutaan varmistaa laadukas kansainvälinen aineistosarja, joka kestää tarkastelua vielä vuosikymmenien ja vuosisatojen päästä.

Tyylitelty maailmankartta jossa on pistein merkitty, mitä maat ovat mukana ISSP-tutkimuksessa.

ISSP:n jäseninä on tällä hetkellä 42 maata, joista 25 on Euroopasta. Mukana ovat maailmanpoliittisesti merkittävät suuret valtiot kuten Yhdysvallat, Venäjä, Kiina ja Intia.

Lisätietoa:

» Tietoarkiston ISSP-sivut
» International Social Survey Programme -tutkimusohjelma
» Gesisin ISSP-sivut
» ISSP-aineistot Ailassa

Annika Valaranta
tietopalveluasiantuntija
etunimi.sukunimi [at] tuni.fi

15. kesäkuuta 2020

Tietoarkisto mahdollistamassa kansainvälistä vertailevaa tutkimusta

Suuri osa Tietoarkiston tekemästä työstä on kansainvälistä yhteistyötä, johon kuuluu myös kaksi merkittävää kansainvälistä aineistonkeruuohjelmaa: International Social Survey Programme (ISSP) ja European Values Survey (EVS). Tietoarkisto on mukana näiden kansainvälisten aineistojen keruun rahoittamisessa, suunnittelussa, käännöstyössä sekä suomalaisen datan käsittelyssä kansainvälisen aineiston vaatimusten mukaiseksi. Tietoarkisto myös arkistoi Suomen maakohtaisen aineiston ISSP:n, EVS:n ja World Values Surveyn (WVS) keruista. Saksalainen sisararkistomme GESIS arkistoi aineistosarjojen kansainväliset aineistot.

Kansainvälinen vertailudata suosittua

Kansainväliset vertailuaineistot kuten ISSP ja EVS kuuluvat Tietoarkiston suosituimpiin aineistoihin, ja palveluportaali Ailassa on tiedot lukuisista julkaisuista, joissa aineistoja käytetään. Aiemmin Ailaan on kuitenkin kerätty julkaisutiedot vain kotimaiseen dataan pohjautuvista julkaisuista. Tänä kesänä käymme läpi kansainvälisiä yhdistelmäaineistoja hyödyntäviä julkaisuja, joissa myös Suomen aineistoa on analysoitu, ja lisäämme niiden tietoja Ailan aineistokuvailuihin.

Monissa maissa ylikansalliset vertailututkimusaineistot ovat muodostuneet tärkeäksi ja suosituksi tutkimusresurssiksi. Vertailuaineistojen ja datan globaalin löydettävyyden kasvava tarve näkyy myös esimerkiksi Euroopan yhteisiä avoimen tieteen pilvipalveluita kehittävässä EOSC-hankkeessa.

Suomi esillä kansainvälisessä tutkimuksessa

Vertailututkimusaineistojen kerääminen on kuitenkin työlästä, sillä yhteensovittamisessa pitää ottaa huomioon eri maiden ja kulttuurien erilaiset käytännöt ja kielet. Yhteistyössä suomalaisten yhteiskuntatieteilijöiden ja tutkimusorganisaatioiden kanssa Tietoarkisto on mahdollistanut viimeisen liki kahdenkymmenen vuoden ajan sen, että Suomi on mukana laajoissa ja tunnetuissa kansainvälisissä aineistosarjoissa.

Laajoihin vertailuaineistojen keruihin osallistuminen mahdollistaa sen, että kotimaiset ilmiöt asettuvat oikeisiin suhteisiinsa ja suomalainen yhteiskunta ja kulttuuri paikalleen muiden joukkoon. Maailmanlaajuisesti tunnettuja tutkimusohjelmia kuten ISSP:tä ja EVS:ää pidetään myös luotettavina sekä hyvin dokumentoituina ja suunniteltuina. Kymmeniätuhansia havaintoyksiköitä sisältäviä kansainvälisiä aineistoja käytetäänkin ahkerasti, sillä ne tarjoavat loputtoman määrän tutkimusasetelmia ja tilastollisia lähestymistapoja.

ISSP- ja WVS/EVS-aineistot ovat tärkeitä myös kotimaisessa yhteiskuntatieteellisessä tutkimuksessa, mutta Suomen datan merkitystä kansainvälisessä kontekstissa ei saa unohtaa. Tietoarkisto seuraa esimerkiksi ISSP:n osalta suomalaisten aineistojen latausten määriä Ailasta, mutta nämä määrät ovat pieniä verrattuna siihen, kuinka paljon saksalaisesta GESISistä ladataan kansainvälisiä yhdistelmäaineistoja. GESISiltä saatujen tilastojen mukaan Suomen datan sisältäviä ISSP-yhdistelmäaineistoja on ladattu vuosina 2016-2019 lähes 30 000 kertaa.

Urakkaa riittää

Kansainvälisten vertailuaineistojen avulla tehdään tutkimusta siis huimia määriä, ja kaikkia Suomen dataa hyödyntäviä julkaisuja ei todennäköisesti koskaan ehditä kirjaamaan Ailaan: pelkästään ISSP:n julkaisuluettelo sisältää yli 9 000 julkaisua, joista suuressa osassa Suomen aineistoja on mukana mutta suuressa osassa ei. Julkaisutietojen kerääminen on työlästä, sillä toistaiseksi niiden koneelliseen haravointiin ei ole olemassa välineitä; kirjattavien julkaisujen selvittäminen vaatii monissa tapauksissa siis julkaisun manuaalista läpikäyntiä.

Tähän mennessä olemme keränneet runsaat kaksisataa viitetietoa Suomen aineistoja hyödyntävistä kansainvälisistä julkaisuista, kuten tutkimusartikkeleista ja monografioista. Työ on siis alkutekijöissään, mutta jo tässä vaiheessa on selvää, että Suomi on näkyvästi vertailevan yhteiskuntatutkimuksen maailmankartalla.

Lisätietoa:

» ISSP:n esittely Tietoarkiston sivuilla
» EVS:n/WVS:n esittely Tietoarkiston sivuilla
» International Social Survey Programme -tutkimusohjelman julkaisuluettelo
» European Values Survey -tutkimusohjelman julkaisuluettelo
» GESIS - Leibniz-Institut für Sozialwissenschaften
» Ailan julkaisuhaku

Niko Koski
tietoasiantuntija
etunimi.sukunimi [at] tuni.fi

Tämä blogikirjoitus on luettavissa myös englanniksi:
FSD Enabling Cross-National Comparative Research.

FSD Enabling Cross-National Comparative Research

A lot of the work done at FSD is related to our international collaboration, which also includes two significant international survey programmes: International Social Survey Programme (ISSP) and European Values Survey (EVS). FSD is involved in the planning and funding of data collection as well as questionnaire translation and processing the data in line with the international requirements. FSD also archives the Finnish data from ISSP, EVS and World Values Survey (WVS). Our German colleagues at GESIS archive the complete international datasets from these programmes.

Comparative data growing in popularity

At FSD, international comparative datasets like ISSP and EVS are among Aila Data Service's most frequently downloaded, and information on several publications utilising data from these programmes are available on Aila. Until now, however, we have only collected information about publications based on the Finnish data, leaving out comparative research done on the complete datasets. This summer, we will go through international publications that have used the international datasets from GESIS with Finnish data included and add their information on Aila Data Service.

In many countries, cross-national comparative research data have become a significant resource for academic research. The growing need for globally discoverable comparative data is also one of the driving factors behind the European Open Science Cloud (EOSC) initiative which aims to build common European open science services.

Finland represented in international research

However, collecting comparative international data is rather labour-intensive. Harmonising data collection instruments and processing the data require consideration of the different practices and languages of different countries and cultures. For two decades, FSD has enabled Finnish participation in broad, well-known international survey programmes in collaboration with Finnish social scientists and research organisations.

Involvement in extensive comparative surveys facilitates researching Finnish society and culture in relation to other countries, enabling the measurement of domestic social phenomena to those abroad. Globally known survey programmes like ISSP and EVS are considered trustworthy, thoroughly documented and well planned. The international datasets covering tens of thousands of individual observations are popular, because they offer a limitless number of research designs and statistical approaches.

Thus, the impact of Finnish data reaches far beyond Finnish borders, although the Finnish ISSP and EVS/WVS datasets are also important in domestic social science research. FSD monitors the number of downloads of ISSP, EVS and WVS data from Aila, but these numbers are small compared to the number of downloads of the complete international datasets from GESIS. For example, the complete ISSP datasets with Finnish data included were downloaded approximately 30,000 times in 2016-2019, according to statistics received from GESIS.

Much work to be done

All in all, monumental amounts of research is done using international comparative datasets, and we will most likely never be able to identify all international publications using Finnish ISSP/EVS/WVS data: for instance, ISSP's official list of publications includes more than 9,000 publications, of which a large part utilise Finnish data but a large part also do not. Charting which publications use Finnish data is an arduous task: publication information currently cannot be machine-harvested, and each publication has to be inspected manually.

Thus far we have collected information on approximately 200 publications such as research articles or monographs that utilise Finnish ISSP, EVS or WVS data. In other words, the work is only beginning. Needless to say, however, that Finland's visibility is remarkable on the world map of comparative social science.

Further information:

» International Social Survey Programme publications
» European Values Survey publications
» ISSP datasets on Aila Data Service
» GESIS - Leibniz-Institut für Sozialwissenschaften
» Aila Data Service, publications search

Niko Koski
Information Specialist
firstname.surname[at] tuni.fi

This blog entry is available also in Finnish:
Tietoarkisto mahdollistamassa kansainvälistä vertailevaa tutkimusta.