← Takaisin blogiin

Kuulostaako tekstisi koneen kirjoittamalta? Näin tarkistat sen

Kysymys esitetään yhä useammin, ja kahdesta aivan eri suunnasta. Jotkut kirjoittajat ovat työskennelleet kielimallin kanssa ja haluavat tietää, näkyykö se. Toiset eivät ole koskaan koskeneet sellaiseen ja pelkäävät silti, että heidän tekstinsä hylätään, koska se ”vaikuttaa koneen kirjoittamalta”. Molemmat huolet ovat ymmärrettäviä, sillä yhä useammat kustantamot, agentit ja kirjoituskilpailut ajavat saapuneet tekstit koneen kirjoittaman tekstin tunnistimen läpi ennen kuin ihminen lukee ne.

Huono uutinen: ei ole olemassa luotettavaa ja lopullista testiä, joka sanoisi kerralla ”tämän on kirjoittanut ihminen”. Hyvä uutinen: kun ymmärrät, mitä nämä tunnistimet todella mittaavat ja kuinka epäluotettavia ne voivat olla, lakkaat pelkäämästä niitä ja teet ainoan asian, joka todella auttaa: kirjoitat niin, että teksti kuulostaa sinulta.

Lyhyt vastaus: tunnistin ei selvitä ”totuutta” tekstin kirjoittajasta, vaan mittaa proosan tilastollista muotoa, ja se erehtyy usein, varsinkin siistin, sujuvan ja hieman muodollisen tekstin kohdalla. Tuomio ”tämä teksti vaikuttaa koneen kirjoittamalta” ei ole todiste. Sen sijaan että etsisit ihmetunnistinta, analysoi tekstiä itse, etsi kohdat, jotka kuulostavat mekaanisilta, ja kirjoita ne uudelleen omalla äänelläsi.

Mitä ”vaikuttaa koneen kirjoittamalta” todella tarkoittaa

Tunnistin ei ymmärrä tarinaasi. Se ei tiedä, vakuuttaako päähenkilösi tai pitääkö loppusi. Se mittaa proosan tilastollista muotoa: kuinka ennustettava jokainen seuraava sana on, kuinka säännöllinen lauseiden rytmi on, kuinka usein turvaudut samoihin rakenteisiin ja kuinka vähän yllätyksiä kohdassa on. Koneen tuottama teksti on yleensä sujuvaa, rytmiltään säännöllistä ja yllätyksetöntä, joten tunnistin pitää juuri tätä säännöllisyyttä signaalina.

Tästä seuraa kaksi asiaa. Ensinnäkin tunnistin arvioi tyyliä, ei rehellisyyttä. Siksi oma huoliteltu ja virheetön proosasi voi saada huonot pisteet, vaikka olet kirjoittanut jokaisen sanan itse. Toiseksi se, mitä esitellään ”koneen tuottaman tekstin tuntomerkkeinä” (kielimallien lempisanat, siististi rivitetyt luettelot, valmiit siirtymäfraasit), on tyylihavainto eikä luotettava testi. Joskus nuo tuntomerkit pitävät paikkansa, joskus ne johtavat harhaan, ja ne muuttuvat jokaisen uuden malliversion myötä. Pidä niitä vihjeinä, älä tuomiona.

Miksi tunnistimet erehtyvät useammin kuin luulet

Tämä ei ole varovainen oletus, vaan vertaisarvioidun tutkimuksen tulos. Stanfordin tutkimusryhmä (Liang ym., 2023, Cell Pressin Patterns-lehdessä) syötti seitsemälle suositulle tunnistimelle esseitä, joiden kirjoittajien äidinkieli ei ole englanti. Tuloksen pitäisi hillitä jokaista, joka pitää näitä työkaluja oraakkeleina: tunnistimet luokittelivat nämä ihmisten kirjoittamat esseet virheellisesti koneen tuottamiksi keskimäärin 61,3 prosentissa tapauksista. Vielä pahempaa: vähintään yksi seitsemästä tunnistimesta merkitsi koneen tekstiksi 89 esseetä 91:stä eli 97,8 prosenttia. Vertailun vuoksi englantia äidinkielenään puhuvien kirjoittajien teksteissä väärien hälytysten osuus oli paljon pienempi.

Johtopäätös on kaksiosainen. Yhtäältä näillä työkaluilla on todellinen ja korkea väärien positiivisten osuus. Toisaalta ne ovat puolueellisia: ne osuvat kovimmin niihin, jotka kirjoittavat yksinkertaisemmin, säännöllisemmin ja ”koulumaisemmin”, ja he ovat usein juuri niitä, jotka vielä opettelevat kirjoittamisen taitoa tai kirjoittavat muulla kuin äidinkielellään. Jos tunnistin joskus merkitsee tekstisi, muista tämä luku. Yhden työkalun tuomio ei ole todiste, vaan arvio, jonka virhemarginaali on suuri.

Näin tarkistat oman tekstisi harkiten

Koska jokainen tunnistin voi yksinään erehtyä, ratkaisevaa on menetelmä eikä usko yhteen työkaluun.

  1. Analysoi ensin kokonaisuus saadaksesi lähtötason. Koko kirjan pistemäärä kertoo, onko ongelma paikallinen vai levinnyt koko tekstiin.
  2. Käy sitten läpi luku kerrallaan. Mekaanisilta kuulostavat kohdat ovat yleensä ryppäinä. Kiireessä tai jonkin työkalun avulla kirjoitettu luku erottuu usein joukosta.
  3. Lue heikoimmat pisteet saaneet lauseet, älä pelkkää pistemäärää. Hyvä tunnistin osoittaa sinulle täsmällisiä lauseita. Nämä lauseet ovat editointilistasi, eivät näytön yläreunassa näkyvä prosentti.
  4. Kirjoita ne uudelleen omin sanoin. Riko liian säännöllinen rytmi, poista täytesanat, korvaa yleiset muotoilut jollakin, mikä kuuluu vain sinun tarinaasi. Aja sitten analyysi uudelleen ja tarkista, että kohta kuulostaa nyt samalta kuin muu kirja.
  5. Älä kilpaile tunnistimen kanssa. Tarkoitus ei ole ”voittaa” työkalua, vaan saada teksti todella kuulostamaan sinulta, ennen kuin joku muu päättää asiasta.

Mitä mekaanisilta kuulostavassa kohdassa kannattaa käytännössä muuttaa? Yleensä samaa, minkä korjaisit editoidessa joka tapauksessa: vaihtele lauseiden pituutta, karsi passiivirakenteita ja yleispäteviä verbejä, lisää konkreettinen yksityiskohta, jonka vain henkilösi tietää. Se ei ole tunnistimen kanssa pelaamista, vaan yksinkertaisesti parempaa proosaa. Siitä kerromme erikseen artikkelissa passiivista proosassa.

Tunnistin romaanikirjailijoille, ei esseille

Useimmat verkosta löytyvät tunnistimet on tehty esseille, artikkeleille ja kotitehtäville. Ne ovat yleiskäyttöisiä, laskevat pisteensä usein yksittäisten sanojen tasolla ja käsittelevät 90 000 sanan romaania yhtenä valtavana liitettävänä tekstimöhkäleenä. Niitä ei ole suunniteltu fiktiolle, lukujakoon eikä sille, miten romaanikirjailija todella kirjoittaa tekstiään uudelleen.

Kirjoitusohjelmilla on päinvastainen ongelma: tekstin tuottamiseen keskittyvissä ohjelmissa ei ilmeisistä syistä ole tunnistinta lainkaan. Useimmat kirjoittajat joutuvat siksi valitsemaan kirjoittamista helpottavan työkalun ja erillisen, yleiskäyttöisen tarkistimen välillä, jota ei ole koskaan ajateltu kirjoja varten. Vellamissa tunnistin on sisäänrakennettu: se arvioi luku luvulta ja koko kirjan tasolla, kuinka mekaaniselta proosa kuulostaa, ja korostaa heikoimmat pisteet saaneet lauseet, jotta voit kirjoittaa ne uudelleen omin sanoin. Rehellisyyden nimissä: tunnistin ei vielä tue suomea. Tällä hetkellä se toimii puolan-, englannin-, saksan-, espanjan-, ranskan-, italian-, portugalin- ja hollanninkielisille käsikirjoituksille. Suomeksi kirjoittaessasi Vellam tarjoaa sen sijaan koko kirjan käsikirjoitusanalyysin ja kirjoitustaidon analyysin, jotka lukevat romaanisi luku luvulta ja osoittavat kohdat, joissa proosa kuulostaa lattealta, geneeriseltä tai persoonattomalta. Yllä kuvattu menetelmä toimii silti: sama lista lauseita, jotka kirjoitat uudelleen omalla äänelläsi, vain ilman prosenttilukua. Lähettämistä edeltävästä tarkistuksesta kerromme lisää artikkelissa romaanin tarkistamisesta ennen lähettämistä.

Muista yksi asia: myös sisäänrakennettu tunnistin antaa arvion eikä oraakkelin vastausta. Pelkkä pisteluku ei ratkaise mitään. Arvo ei ole prosentissa, vaan korostetuissa lauseissa, joiden parissa voit tehdä työtä.

Mitä kannattaa välttää

Lopuksi kolme ansaa, joihin on helppo langeta heti, kun pelkää tekstinsä kuulostavan mekaaniselta.

Älä kirjoita koko kirjaasi uudelleen pisteiden vuoksi

Jos tunnistin antaa korkean prosentin mutta teksti on todella sinun, vika on työkalussa eikä tekstissä. Lue merkityt lauseet ja arvioi ne itse.

Älä luota yhteen tunnistimeen

Kun väärien hälytysten osuus ihmisen proosasta on 61 prosenttia, yksittäinen tuomio ei ratkaise mitään. Vertaa tarvittaessa muutaman tunnistimen tuloksia ja lue konkreettiset kohdat.

Älä sekoita sujuvuutta syyllisyyteen

Siisti ja säännöllinen lause ei ole todiste koneesta. Joskus se on yksinkertaisesti siisti lause. Muuta lausetta, jos se kuulostaa persoonattomalta, älä siksi, että jokin työkalu hälyttää punaisella.

Usein kysytyt kysymykset

Ovatko koneen tuottaman tekstin tunnistimet luotettavia?

Vain osittain. Vuonna 2023 julkaistu vertaisarvioitu Stanfordin tutkimus osoitti, että suositut tunnistimet luokittelivat ihmisten kirjoittamat esseet virheellisesti koneen tuottamiksi keskimäärin 61,3 prosentissa tapauksista ja että vähintään yksi seitsemästä tunnistimesta merkitsi koneen tuottamaksi 97,8 prosenttia teksteistä. Yhden työkalun tuomio on arvio, jonka virhemarginaali on suuri, eikä todiste kirjoittajan henkilöllisyydestä.

Mistä tietää, kuulostaako teksti koneen kirjoittamalta?

Tunnistimet reagoivat proosan tilastolliseen muotoon: sanojen suureen ennustettavuuteen, säännölliseen lauserytmiin, toistuviin rakenteisiin ja yllätysten vähyyteen. Niin sanotut ”koneen tuottaman tekstin tuntomerkit” ovat tyylihavaintoja eivätkä luotettava testi, ja ne muuttuvat jokaisen uuden malliversion myötä. Pidä niitä vihjeinä ja perusta päätöksesi siihen, kuulostaako kohta sinulta.

Voidaanko tekstini merkitä koneen tekstiksi, vaikka kirjoitin sen itse?

Voidaan, ja niin käy usein. Tunnistimet osuvat kovimmin niihin, jotka kirjoittavat yksinkertaisemmin, säännöllisemmin ja muodollisemmin, muun muassa kirjoittamisen taitoa opetteleviin ja kirjoittajiin, jotka eivät kirjoita äidinkielellään. Väärä merkintä ei tarkoita, että olisit tehnyt jotain väärin, vaan että työkalu erehtyy.

Miten mekaaniselta kuulostavaa kohtaa voi parantaa?

Yleensä samoin kuin parantaisit sitä editoidessa: vaihtele lauseiden pituutta, karsi yleispätevät verbit ja passiivirakenteet, lisää konkreettinen yksityiskohta omasta tarinastasi ja riko liian säännöllinen rytmi. Tarkoitus ei ole voittaa tunnistinta, vaan saada lause kuulostamaan samalta kuin muu kirjasi.

Vellam lukee suomenkielisen käsikirjoituksesi luku luvulta ja näyttää kirjoitustaidon analyysissa kohdat, joissa proosa kuulostaa lattealta tai geneeriseltä, jotta voit kirjoittaa ne uudelleen omin sanoin. Ensimmäiset noin 5 000 sanaa ovat ilmaisia.

Kokeile Vellamia →

Tekstisi pysyy sinun · Emme koskaan kouluta sillä malleja

Katso, mitä käsikirjoitusanalyysi löytää koko kirjasta →