Tech / Jövő

Hogyan gondolkodik a ChatGPT?

Kollektíva szerkesztőség · · 3 perc olvasás

Amikor a ChatGPT-vel beszélgetünk, hajlamosak vagyunk önálló tudattal rendelkező elmét sejteni mögötte, pedig a rendszer pusztán hatalmas adathalmazokból építkező statisztikai valószínűségeket számol. Egy sor friss tudományos áttekintés és elemzés rávilágít arra, miként mérik a kutatók ezeknek a modelleknek a teljesítményét, és miért kísérti őket folyamatosan a tévedés veszélye.

PLEASE CREDIT THIS IMAGE PROPERLY AS PER INSTRUCTIONS BELOW IF YOU CHOOSE TO USE
An image for blogs and news sites dealing with artificial intelligence, AI, machine learning, smart computers etc
Want
ⓘFotó: mikemacmarketing / Wikimedia Commons, CC BY 2.0

Röviden

  • A nagy nyelvi modellek (LLM-ek) óriási szöveges adatbázisokon végzett statisztikai tanulás révén generálnak nyelvet.
  • A mesterséges neurális hálózatok kizárólag dekóderes, transzformer alapú architektúrával dolgozzák fel a hatalmas adatmennyiséget.
  • A modellek egyik legnagyobb kihívása a hallucináció, vagyis amikor meggyőzően, de tévesen állítanak dolgokat.
  • A kutatók a hatékonyság mérésére és az ügynökalapú rendszerek fejlesztésére külön értékelési módszertanokat alkalmaznak.

A gépi nyelvészet rejtett mechanizmusa

A modern mesterséges intelligencia alapját képező nagy nyelvi modellek (LLM-ek) nem úgy értenek meg minket, ahogyan egy másik ember tenné. Az ACM Transactions on Intelligent Systems and Technology szaklapban megjelent áttekintés szerint ezek a rendszerek hatalmas mennyiségű, heterogén szöveges forrásból sajátítják el a nyelvi mintázatokat egy önfelügyelt és félig felügyelt tanulási folyamat során. A Wikipédia gyűjtése is megerősíti, hogy a jelenleg elérhető legfejlettebb modellek kizárólag dekóderes, transzformer alapú neurális hálózatokból épülnek fel, amelyek képesek kezelni a szintaxist, a szemantikát és a különböző emberi nyelvi korpuszokban rejlő összefüggéseket.

A folyamat lényege a predikció: a modell azt jósolja meg, hogy egy adott szövegkörnyezet után logikusan milyen szó vagy kifejezés következhet. Ez a statisztikai alapú működés magában hordozza mindazokat a nyelvi sajátosságokat, amelyek az internetes forrásokból származó adatokban is jelen vannak. A technológia története a huszadik század statisztikai fordítási modelljeitől indult, és a 2010-es évek végén bekövetkezett neurális forradalom révén jutott el a mai összetett rendszerekig.

Amikor a modell magabiztosan téved

Az ACM Transactions on Information Systems folyóiratban közölt tanulmány részletesen elemzi az úgynevezett hallucináció jelenségét. Ez azt takarja, amikor a mesterséges intelligencia hihető, de tárgyilag hamis információkat generál. Mivel a modellek nyitott és általános célú rendszerek, ez a viselkedés komoly akadályt jelent a valós idejű információkeresésben és a megbízhatóság terén. A kutatók intenzíven keresik azokat a módszereket, amelyekkel a hallucinációk detektálhatók és mérsékelhetők.

A problémát súlyosbítja, hogy a nyelvi modellek nem igazán tényeket raktároznak el adatszerűen, hanem nyelvi valószínűségeket illesztenek össze. Ha egy kérdésre nincs pontos válasz a minták között, a prediktív mechanizmus akkor is megpróbál egy folytonos, nyelvtanilag tökéletes mondatsorozatot összeállítani, ami a felhasználó számára hitelesnek tűnhet, még akkor is, ha valótlan állításokat tartalmaz.

Hogyan mérik a gépi intelligenciát?

A tudományos világ kiemelt figyelmet fordít arra, hogy objektíven értékelje ezeket a rendszereket. A Frontiers of Computer Science kutatása szerint a felmérések négy fő dimenzióra terjednek ki: az előbetanítási (pre-training) módszertanokra, az utóbetanítási (post-training) technikákra, a felhasználási stratégiákra és a strukturált értékelési módszerekre. A kutatók vizsgálják a modellek teljesítményét olyan területeken is, mint az oktatás, az etika, a természettudományok vagy a társadalomtudományok.

Autonóm ágensek és a jövő korlátai

A Frontiers of Computer Science egy másik tanulmánya az autonóm ágensek szerepét vizsgálja. Korábban a gépi rendszereket izolált környezetben, szűk tudásbázissal képezték ki, ami távol állt az emberi tanulási folyamatoktól. A mai LLM-alapú ágensek azonban a világhálón található hatalmas tudásmennyiség birtokában már képesek emberi szintűnek tűnő döntések meghozatalára is a mérnöki és tudományos feladatokban.

Azonban a technológia korlátai továbbra is nyilvánvalóak. A modellek öröklik a betanító adataikban meglévő torzításokat, és a hatékony skálázás, valamint az elméleti alapok hiányosságai mind olyan nyitott kérdések, amelyekkel a kutatóknak szembe kell nézniük. A mesterséges intelligencia fejlődése nem egy kész, tévedhetetlen entitás megjelenését jelenti, hanem egy folyamatosan finomított, statisztikai alapokon nyugvó eszköz tökéletesítését.

Ez a cikk nem helyettesíti az orvosi vagy más szakértői véleményt.

Oszd megFacebookWhatsAppX
Források (6)