Minimum hosszDetektálásNehézség

Miért nehéz rövid szövegből detektálni?

A túl rövid szövegek nem rendelkeznek a szükséges statisztikai és nyelvi jellemzőkkel ahhoz, hogy megbízhatóan el lehessen dönteni a szöveg forrását (AI vagy ember).

minimum_60 felirat a képen

Miért kell minimum szószám a detektáláshoz?

A túl rövid szövegek nem rendelkeznek a szükséges statisztikai és nyelvi jellemzőkkel ahhoz, hogy megbízhatóan el lehessen dönteni a szöveg forrását (AI vagy ember). A rövid szövegeket ezen okból jelöljük az eredményt jelző oldalon.

A Preds modellje kifejezetten a nagy pontosságú és alacsony fals pozitív arányú detektálásra lett optimalizálva. Ennek ellenére a predikció indításához minimum 60 szavas bemenetet határoztunk meg. De miért is kell ez a korlát, ha a modell jól működik?

A nagy nyelvi modellek (LLM-ek) felismerése általában valószínűségi mintázatokon, szókapcsolatok előfordulásán és szövegszerkezeti összefüggéseken is múlik. Egy emberi és egy szintetikus szöveg stílusa közötti valódi különbség nem egy-egy szóban, hanem a gondolatmenet felépítésében, a mondatok hosszának varianciájában és a szemantikai különbségekben rajzolódik ki.

Vegyünk egy tipikus példát: angol nyelven a kutatások szerint bizonyos szavak (mint a hírhedt „delve” vagy a túlzottan választékos kötőszavak) arányaiban lényegesen gyakrabban fordulnak elő gépi szövegekben. Önmagában viszont egy ilyen szót bárki leírhat, nem rendelkezik önálló jelentéssel. Magyar nyelven is megvannak ezek a szavak, szókapcsolatok.

Három példa, amik arányosítva többször fordulnak elő a szintetikus szövegekben:

ellenérv, kulcsszerepet, elengedhetetlen

A nyelvi modellek nagy előszeretettel használják ezeket a szavakat, míg emberi szövegekben ritkábban láthatóak. A saját, 3 millió szövegből álló adathalmazunkból kiszűrtük a különbségeket az emberi és a generált szövegek között, így ha egy szókettes vagy szóhármas sokkal többször megjelenik egy AI-szövegben, azt is megjelenítjük a detektálásnál.

A megoldásunk a Predsnél

Nem célunk bizonytalan, félrevezető előrejelzést adni egy-két mondatos bemenetekre. A minimum 60 szavas korlát garantálja, hogy a Preds modellje kontextust kapjon a mélyebb nyelvi mintázatok feltárásához.

Ez a küszöbérték biztosítja azt, hogy az elemzés eredménye ne egy véletlenszerű tipp, hanem egy megbízható predikció legyen.