Idi na sadržaj

Generativni prethodno obučeni transformator

S Wikipedije, slobodne enciklopedije

Generativni prethodno obučeni transformator (engleski: generative pre-trained transformer; GPT) jest vrsta velikog jezičkog modela koja se široko koristi u generativnoj umjetnoj inteligenciji, naročito u čet-botovima.[1][2] GPT modeli zasnivaju se na arhitekturi transformera i prethodno se obučavaju na velikim skupovima neoznačenih podataka, nakon čega mogu generirati novi sadržaj.[3]

OpenAI je prvi primijenio generativno prethodno obučavanje na arhitekturu transformera i 2018. predstavio model GPT-1.[4] Kasnije su objavljeni veći i sposobniji modeli, a nakon izlaska ChatGPT-a krajem 2022. godine GPT-ovi i srodni modeli postali su jedna od središnjih tehnologija savremene umjetne inteligencije.[5]

Pozadina

[uredi | uredi izvor]

Tokom 2010-ih napredak u mašinskom učenju, snažniji računari i rast količine digitaliziranog materijala stvorili su uvjete za ubrzani razvoj umjetne inteligencije.[6]

Koncept generativnog prethodnog obučavanja postojao je i prije pojave GPT-a. Riječ je o postupku u kojem se model prvo obučava na velikom neoznačenom skupu podataka, a zatim prilagođava konkretnom zadatku pomoću označenih podataka.[7]

Temeljna tehnologija GPT-a jest arhitektura transformera, koja je omogućila efikasniju obradu čitavih nizova teksta i obuku većih jezičkih modela nego što je to bilo uobičajeno kod starijih pristupa zasnovanih na rekurentnim neuronskim mrežama.[3][4]

Historija

[uredi | uredi izvor]

Dana 11. juna 2018. istraživači OpenAI-ja objavili su rad Improving Language Understanding by Generative Pre-Training (Poboljšanje razumijevanja jezika generativnom prethodnom obukom), kojim je predstavljen GPT-1, prvi GPT model.[4] Model je kombinirao prethodno obučavanje na korpusu BookCorpus s naknadnim finim podešavanjem za posebne zadatke obrade prirodnog jezika.[4]

OpenAI je 14. februara 2019. predstavio GPT-2, znatno veći model sposoban za koherentnije generiranje teksta.[8] Zbog zabrinutosti u vezi s mogućom zloupotrebom, puni model nije odmah objavljen, nego postepeno.[9]

U maju 2020. objavljen je GPT-3, model s 175 milijardi parametara, koji je značajno unaprijedio sposobnosti rješavanja zadataka na osnovu malog broja primjera ili bez posebnog dodatnog obučavanja.[10]

Kasnije su nastali modeli kao što su GPT-4, multimodalni veliki jezički model sposoban za obradu tekstualnog i slikovnog ulaza,[5] te GPT-4o, koji može obrađivati i generirati tekst, slike i zvuk.[11] OpenAI je 2025. objavio GPT-5, za koji je navedeno da koristi usmjerivač koji bira između bržeg modela i sporijeg modela za zaključivanje, ovisno o zadatku.[12][13]

Popularnost ChatGPT-a potaknula je razvoj brojnih konkurentskih sistema drugih organizacija, uključujući Googleove modele PaLM i Gemini, Metin Llama, kao i otvorene modele organizacija poput EleutherAI.[14][15]

Temeljni modeli

[uredi | uredi izvor]

Temeljni model jest model umjetne inteligencije obučen na širokim skupovima podataka u velikim razmjerama tako da se može prilagoditi velikom broju naknadnih zadataka.[16][17] GPT serija predstavlja jednu od najpoznatijih porodica takvih modela.

Osim OpenAI-jevih GPT modela, među srodne temeljne modele ubrajaju se i PaLM, Llama te razni otvoreni GPT-slični sistemi.[14][18]

Iako su GPT modeli prvobitno bili usmjereni prvenstveno na tekst, kasniji modeli razvijeni su i kao multimodalni sistemi, što znači da mogu obrađivati više vrsta ulaznih i izlaznih podataka.[5][11]

Modeli specifični po zadatku

[uredi | uredi izvor]

Temeljni GPT model može se dodatno prilagoditi konkretnim zadacima ili oblastima pomoću finog podešavanja i drugih postupaka, uključujući inženjering promptova.[19]

Važan primjer takve prilagodbe jest InstructGPT, skup modela koji su dodatno obučeni da slijede upute kombinacijom nadziranog učenja i učenja s pojačanjem iz ljudske povratne informacije (RLHF).[20][21] Ovakvi modeli pokazali su veću preciznost, manje štetnih ili toksičnih izlaza i bolju usklađenost s korisničkim potrebama.[22]

Među često navođenim primjerima GPT sistema usmjerenih na određene oblasti nalaze se EinsteinGPT za prodaju i marketing, BloombergGPT za finansije, Khanmigo za obrazovanje, Slack GPT za komunikaciju u okviru platforme Slack te BioGPT za biomedicinsko područje.[23]

Pitanja brenda

[uredi | uredi izvor]

OpenAI je 2023. tvrdio da izraz GPT treba posmatrati i kao brend povezan s njegovim proizvodima te je izmijenio smjernice tako da drugim korisnicima njegovog API-ja više nije dopušteno da GPT uključuju u nazive vlastitih proizvoda ili usluga.[24] Istovremeno je OpenAI unutar vlastite platforme omogućio izradu prilagođenih verzija ChatGPT-a nazvanih GPTs.[25]

Također pogledaj

[uredi | uredi izvor]

Reference

[uredi | uredi izvor]
  1. "Generative AI: a game-changer society needs to be ready for". World Economic Forum. 9. 1. 2023. Pristupljeno 11. 3. 2026.
  2. "The A to Z of Artificial Intelligence". Time. 13. 4. 2023. Pristupljeno 11. 3. 2026.[mrtav link]
  3. 1 2 "Improving language understanding with unsupervised learning". OpenAI. 11. 6. 2018. Pristupljeno 11. 3. 2026.
  4. 1 2 3 4 Radford, Alec; Narasimhan, Karthik; Salimans, Tim; Sutskever, Ilya (11. 6. 2018). Improving Language Understanding by Generative Pre-Training (PDF) (Report). OpenAI. Pristupljeno 11. 3. 2026.
  5. 1 2 3 "GPT-4 Technical Report". arXiv. 15. 3. 2023. arXiv:2303.08774. Pristupljeno 11. 3. 2026.
  6. "An understanding of AI's limitations is starting to sink in". The Economist. 11. 6. 2020. Pristupljeno 11. 3. 2026.
  7. Erhan, Dumitru; Courville, Aaron; Bengio, Yoshua; Vincent, Pascal (31. 3. 2010). "Why Does Unsupervised Pre-training Help Deep Learning?". Proceedings of the Thirteenth International Conference on Artificial Intelligence and Statistics. 9: 201–208. Pristupljeno 11. 3. 2026.
  8. Radford, Alec; Wu, Jeffrey; Child, Rewon; Luan, David; Amodei, Dario; Sutskever, Ilya (14. 2. 2019). Language Models are Unsupervised Multitask Learners (PDF) (Report). OpenAI. Pristupljeno 11. 3. 2026.
  9. Vincent, James (7. 11. 2019). "OpenAI has published the text-generating AI it said was too dangerous to share". The Verge. Pristupljeno 11. 3. 2026.
  10. Brown, Tom B.; Mann, Benjamin; Ryder, Nick; Subbiah, Melanie; Kaplan, Jared; Dhariwal, Prafulla; Neelakantan, Arvind; Shyam, Pranav; Sastry, Girish; Askell, Amanda; Agarwal, Sandhini; Herbert-Voss, Ariel; Krueger, Gretchen; Henighan, Tom; Child, Rewon; Ramesh, Aditya; Ziegler, Daniel M.; Wu, Jeffrey; Winter, Clemens; Hesse, Christopher; Chen, Mark; Sigler, Eric; Litwin, Mateusz; Gray, Scott; Chess, Benjamin; Clark, Jack; Berner, Christopher; McCandlish, Sam; Radford, Alec; Sutskever, Ilya; Amodei, Dario (28. 5. 2020). "Language Models are Few-Shot Learners". arXiv. arXiv:2005.14165. Pristupljeno 11. 3. 2026.
  11. 1 2 Colburn, Thomas (13. 5. 2024). "OpenAI unveils GPT-4o, a fresh multimodal AI flagship model". The Register. Pristupljeno 11. 3. 2026.[mrtav link]
  12. Heath, Alex (7. 8. 2025). "GPT-5 is being released to all ChatGPT users". The Verge. Pristupljeno 11. 3. 2026.
  13. "Introducing GPT-5". OpenAI. 7. 8. 2025. Pristupljeno 11. 3. 2026.
  14. 1 2 Vincent, James (14. 3. 2023). "Google opens up its AI language model PaLM to challenge OpenAI and GPT-3". The Verge. Pristupljeno 11. 3. 2026.
  15. Alford, Anthony (13. 7. 2021). "EleutherAI Open-Sources Six Billion Parameter GPT-3 Clone GPT-J". InfoQ. Pristupljeno 11. 3. 2026.[mrtav link]
  16. "Introducing the Center for Research on Foundation Models (CRFM)". Stanford HAI. 18. 8. 2021. Pristupljeno 11. 3. 2026.
  17. "Reflections on Foundation Models". Stanford HAI. 18. 10. 2021. Pristupljeno 11. 3. 2026.
  18. "Meta Debuts AI Language Model, But It's Only for Researchers". PCMag. 24. 2. 2023. Pristupljeno 11. 3. 2026.
  19. Bommasani, Rishi; Hudson, Drew A.; Adeli, Ehsan; Altman, Russ B.; Arora, Simran; von Arx, Sydney; et al. (12. 7. 2022). "On the Opportunities and Risks of Foundation Models". arXiv. arXiv:2108.07258. Pristupljeno 11. 3. 2026.
  20. "Aligning language models to follow instructions". OpenAI. 27. 1. 2022. Pristupljeno 11. 3. 2026.
  21. Ouyang, Long; Wu, Jeff; Jiang, Xu; Alain, Gabriel; Alessandri, Carroll L.; Ally, Rimel; et al. (4. 3. 2022). "Training language models to follow instructions with human feedback". NeurIPS. arXiv:2203.02155. Pristupljeno 11. 3. 2026.
  22. Ramnani, Meeta (28. 1. 2022). "OpenAI dumps its own GPT-3 for something called InstructGPT, and for right reason". Analytics India Magazine. Pristupljeno 11. 3. 2026.
  23. Luo, Renqian; Sun, Linyi; Xia, Yiming; Qin, Tian; Zhang, Shangwen; Poon, Hoifung; Liu, Tie-Yan (2022). "BioGPT: generative pre-trained transformer for biomedical text generation and mining". Briefings in Bioinformatics. 23 (6). doi:10.1093/bib/bbac409. Pristupljeno 11. 3. 2026.
  24. "OpenAI Brand Guidelines". OpenAI. Pristupljeno 11. 3. 2026.
  25. "Introducing GPTs". OpenAI. 6. 11. 2023. Pristupljeno 11. 3. 2026.