Miért nehéz rövid szövegből detektálni?
A túl rövid szövegek nem rendelkeznek a szükséges statisztikai és nyelvi jellemzőkkel ahhoz, hogy megbízhatóan el lehessen dönteni a szöveg forrását (AI vagy ember).

Miért kell minimum szószám a detektáláshoz?
A túl rövid szövegek nem rendelkeznek a szükséges statisztikai és nyelvi jellemzőkkel ahhoz, hogy megbízhatóan el lehessen dönteni a szöveg forrását (AI vagy ember). A rövid szövegeket ezen okból jelöljük az eredményt jelző oldalon.
A Preds modellje kifejezetten a nagy pontosságú és alacsony fals pozitív arányú detektálásra lett optimalizálva. Ennek ellenére a predikció indításához minimum 60 szavas bemenetet határoztunk meg. De miért is kell ez a korlát, ha a modell jól működik?
A nagy nyelvi modellek (LLM-ek) felismerése általában valószínűségi mintázatokon, szókapcsolatok előfordulásán és szövegszerkezeti összefüggéseken is múlik. Egy emberi és egy szintetikus szöveg stílusa közötti valódi különbség nem egy-egy szóban, hanem a gondolatmenet felépítésében, a mondatok hosszának varianciájában és a szemantikai különbségekben rajzolódik ki.
Vegyünk egy tipikus példát: angol nyelven a kutatások szerint bizonyos szavak (mint a hírhedt „delve” vagy a túlzottan választékos kötőszavak) arányaiban lényegesen gyakrabban fordulnak elő gépi szövegekben. Önmagában viszont egy ilyen szót bárki leírhat, nem rendelkezik önálló jelentéssel. Magyar nyelven is megvannak ezek a szavak, szókapcsolatok.
Három példa, amik arányosítva többször fordulnak elő a szintetikus szövegekben:
ellenérv, kulcsszerepet, elengedhetetlen
A nyelvi modellek nagy előszeretettel használják ezeket a szavakat, míg emberi szövegekben ritkábban láthatóak. A saját, 3 millió szövegből álló adathalmazunkból kiszűrtük a különbségeket az emberi és a generált szövegek között, így ha egy szókettes vagy szóhármas sokkal többször megjelenik egy AI-szövegben, azt is megjelenítjük a detektálásnál.
A megoldásunk a Predsnél
Nem célunk bizonytalan, félrevezető előrejelzést adni egy-két mondatos bemenetekre. A minimum 60 szavas korlát garantálja, hogy a Preds modellje kontextust kapjon a mélyebb nyelvi mintázatok feltárásához.
Ez a küszöbérték biztosítja azt, hogy az elemzés eredménye ne egy véletlenszerű tipp, hanem egy megbízható predikció legyen.