შინაარსზე გადასვლა

ენობრივი მოდელი

მასალა ვიკიპედიიდან — თავისუფალი ენციკლოპედია

ენობრივი მოდელი (ინგლ. language model) — გამოთვლითი მოდელი, რომელიც პროგნოზირებს თანმიმდევრობებს ბუნებრივ ენაზე.[1] ენობრივი მოდელები სასარგებლოა სხვადასხვა ამოცანისთვის, მათ შორის მეტყველების ამოცნობისთვის,[2] მანქანური თარგმანისთვის, ბუნებრივი ენის გენერირებისთვის (უფრო მეტად ადამიანის მსგავსი ტექსტის გენერირება), ოპტიკური სიმბოლოების ამოცნობისთვის, მარშრუტის ოპტიმიზაციისთვის,[3] ხელნაწერის ამოცნობისთვის, გრამატიკის ინდუქციისთვის, ინფორმაციის მოძიებისთვის და კატასტროფებზე რეაგირებისთვის.[4]

დიდი ენობრივი მოდელები (LLM), რომლებიც ყველაზე განვითარებული ფორმაა 2026 წლის მდგომარეობით, ძირითადად დაფუძნებულია ტრანსფორმერებზე, რომლებიც გაწვრთნილია უფრო დიდ მონაცემთა ნაკრებებზე (ხშირად იყენებენ ინტერნეტიდან აღებულ საჯარო ტექსტებს). მათ ჩაანაცვლეს რეკურენტული ნეირონული ქსელების ბაზაზე დაფუძნებული მოდელები, რომლებმაც ადრე ჩაანაცვლეს წმინდა სტატისტიკური მოდელები, როგორიცაა სიტყვების n-gram ენობრივი მოდელი.

ნოამ ჩომსკიმ 1950-იან წლებში ენობრივ მოდელებზე პიონერული მუშაობა ჩაატარა ფორმალური გრამატიკის თეორიის შემუშავებით.[5]

1980 წელს სტატისტიკური მიდგომები იქნა შესწავლილი და აღმოჩნდა, რომ ისინი უფრო სასარგებლოა მრავალი მიზნისთვის, ვიდრე წესებზე დაფუძნებული ფორმალური გრამატიკები. დისკრეტულმა წარმოდგენებმა, როგორიცაა სიტყვების n-gram ენობრივი მოდელები, სიტყვების დისკრეტული კომბინაციების ალბათობებით, მნიშვნელოვანი წინსვლა განიცადეს.

2000-იან წლებში სიტყვების უწყვეტმა წარმოდგენებმა, როგორიცაა სიტყვების ჩანერგვა, დისკრეტული წარმოდგენების ჩანაცვლება დაიწყო. [6] როგორც წესი, წარმოდგენა არის რეალური მნიშვნელობის ვექტორი, რომელიც კოდირებს სიტყვის მნიშვნელობას ისე, რომ ვექტორულ სივრცეში უფრო ახლოს მდებარე სიტყვები მნიშვნელობით მსგავსია და სიტყვებს შორის საერთო ურთიერთობები, როგორიცაა მრავლობითი რიცხვი ან სქესი, შენარჩუნებულია.

წმინდა სტატისტიკური მოდელები

[რედაქტირება | წყაროს რედაქტირება]

1980 წელს შემოთავაზებული იქნა პირველი მნიშვნელოვანი სტატისტიკური ენობრივი მოდელი და ათწლეულის განმავლობაში IBM-მა ჩაატარა „შენონის სტილის“ ექსპერიმენტები, რომლებშიც ენის მოდელირების გაუმჯობესების პოტენციური წყაროები გამოვლინდა ტექსტის პროგნოზირების ან კორექტირების პროცესში ადამიანის მიერ ჩატარებული ექსპერიმენტების დაკვირვებითა და ანალიზით.[7]

სიტყვების n-gram-ებზე დაფუძნებული მოდელები

[რედაქტირება | წყაროს რედაქტირება]

სიტყვების n-gram ენის მოდელი არის ენის სტატისტიკური მოდელი, რომელიც თანმიმდევრობაში მომდევნო სიტყვის ალბათობას გამოთვლის ფიქსირებული ზომის ფანჯრის მიხედვით, რომელიც წინა სიტყვებისგან შედგება. თუ გათვალისწინებულია ერთი წინა სიტყვა, ეს არის ბიგრამის მოდელი; თუ ორი სიტყვაა, ტრიგრამის მოდელი; თუ n − 1 სიტყვაა, n-gram მოდელი.

წინადადების დასაწყისისა და დასასრულის აღსანიშნავად შემოდის სპეციალური ნიშნები (⟨s⟩ და ⟨/s⟩)

უხილავი სიტყვებისთვის ნულოვანი ალბათობის მინიჭების თავიდან ასაცილებლად, თითოეული ნანახი სიტყვის ალბათობა ოდნავ მცირდება, რათა მოცემულ კორპუსში უხილავი სიტყვებისთვის ადგილი გამოთავისუფლდეს. ამის მისაღწევად გამოიყენება სხვადასხვა გასწორების მეთოდი, მარტივი „ერთის დამატების“ გასწორებიდან (უხილავი n-gram-ებისთვის 1-ის რაოდენობის მინიჭება, როგორც არაინფორმაციული წინაპირობა) უფრო დახვეწილ ტექნიკებამდე, როგორიცაა Good-Turing-ის დისკონტირება ან უკან დახევის მოდელები.

სიტყვის n-gram-ის მოდელები დიდწილად შეიცვალა რეკურენტული ნეირონული ქსელების მოდელებით, რომლებიც, თავის მხრივ, შეიცვალა ტრანსფორმერზე დაფუძნებული მოდელებით, რომლებსაც ხშირად დიდ ენობრივ მოდელებს უწოდებენ.

ნეირონული მოდელები

[რედაქტირება | წყაროს რედაქტირება]

რეკურენტული ნეირონული ქსელი

[რედაქტირება | წყაროს რედაქტირება]

სიტყვების უწყვეტი წარმოდგენები ან ჩანერგვები წარმოიქმნება რეკურენტულ ნეირონულ ქსელზე დაფუძნებულ ენობრივ მოდელებში (ასევე ცნობილი როგორც უწყვეტი სივრცის ენობრივი მოდელები).[8] ასეთი უწყვეტი სივრცის ჩანერგვები ხელს უწყობს ე.წ. „განზომილების წყევლის“ შემსუბუქებას, რაც სიტყვების შესაძლო თანმიმდევრობების რაოდენობის ექსპონენციურად ზრდის შედეგია ლექსიკის ზომასთან ერთად, რაც კიდევ უფრო იწვევს მონაცემთა სიმცირის პრობლემას. ნეირონული ქსელები ამ პრობლემას თავს არიდებენ სიტყვების ნეირონულ ქსელში წონების არაწრფივი კომბინაციების სახით წარმოდგენით.[9]

შეფასება და საორიენტაციო მაჩვენებლები

[რედაქტირება | წყაროს რედაქტირება]

ენობრივი მოდელების ხარისხის შეფასება ძირითადად ხდება ტიპიური ენობრივი ამოცანების შედეგად შექმნილ ადამიანის მიერ შექმნილ ნიმუშებთან შედარებით. სხვა, ნაკლებად დამკვიდრებული, ხარისხის ტესტები იკვლევს ენობრივი მოდელის შინაგან ხასიათს ან ადარებს ორ ასეთ მოდელს. ვინაიდან ენობრივი მოდელები, როგორც წესი, განკუთვნილია დინამიური იყოს და ისწავლოს მათ მიერ ნანახი მონაცემებიდან, ზოგიერთი შემოთავაზებული მოდელი იკვლევს სწავლის სიჩქარეს, მაგალითად, სწავლის მრუდების შემოწმების გზით.[10]

ენის დამუშავების სისტემების შეფასებისთვის შემუშავებულია სხვადასხვა მონაცემთა ნაკრები.[11] ესენია:

  • მასიური მრავალამოცანიანი ენის გაგება (MMLU)[12]
  • ენობრივი მისაღებობის კორპუსი[13]
  • ენობრივი გაგების ზოგადი შეფასების (GLUE) საორიენტაციო მაჩვენებელი[14]
  • Microsoft Research-ის პარაფრაზის კორპუსი[15]
  • მრავალჟანრული ბუნებრივი ენის ინფერენცია[16]
  • კითხვითი ბუნებრივი ენის დასკვნა
  • Quora-ს კითხვების წყვილები[17]
  • ტექსტური შინაარსის ამოცნობა[18]
  • სემანტიკური ტექსტური მსგავსების საორიენტაციო ნიშანი
  • SQuAD კითხვა-პასუხის ტესტი[19]
  • სტენფორდის ემოციური მონაცემების ბაზა[20]
  • ვინოგრადის ბუნებრივ ენაზე გამოტანის მეთოდი (NLI)
  • BoolQ, PIQA, SIQA, HellaSwag, WinoGrande, ARC, OpenBookQA, NaturalQuestions, TriviaQA, RACE, BIG-bench hard, GSM8k, RealToxicityPrompts, WinoGender, CrowS-Pairs[21]
  1. Jurafsky, Dan; Martin, James H. (2021). „N-gram Language Models“, Speech and Language Processing, 3rd. 
  2. Kuhn, R.; De Mori, R. (1990). „A cache-based natural language model for speech recognition“. IEEE Transactions on Pattern Analysis and Machine Intelligence. 12 (6): 570–583. Bibcode:1990ITPAM..12..570K. doi:10.1109/34.56193.
  3. Liu, Yang; Wu, Fanyou; Liu, Zhiyuan; Wang, Kai; Wang, Feiyue; Qu, Xiaobo (2023). "Can language models be used for real-world urban-delivery route optimization?"
  4. Maity, Abhishek (March 2026). „CrisisSense: Transforming Social Signals into Real-Time Disaster Awareness via Deep Neural Intelligence“, 2026 IEEE Madhya Pradesh Section Conference (MPCON), გვ. 1501–1506. DOI:10.1109/MPCON69668.2026.11508516. ISBN 979-8-3315-9335-3. 
  5. Chomsky, N. (September 1956). „Three models for the description of language“. IRE Transactions on Information Theory. 2 (3): 113–124. Bibcode:1956IRTIT...2..113C. doi:10.1109/TIT.1956.1056813. ISSN 2168-2712.
  6. „The Nature Of Life, The Nature Of Thinking: Looking Back On Eugene Charniak's Work And Life“ (ინგლისური). 2022-02-22. დაარქივებულია ორიგინალიდან — 3 November 2024. ციტირების თარიღი: 2025-02-05.
  7. Rosenfeld, Ronald (2000). „Two decades of statistical language modeling: Where do we go from here?“. Proceedings of the IEEE. 88 (8): 1270–1278. Bibcode:2000IEEEP..88.1270R. doi:10.1109/5.880083. S2CID 10959945.
  8. Karpathy, Andrej. The Unreasonable Effectiveness of Recurrent Neural Networks. დაარქივებულია ორიგინალიდან — 1 November 2020. ციტირების თარიღი: 27 January 2019
  9. Devlin, Jacob; Chang, Ming-Wei; Lee, Kenton; Toutanova, Kristina (10 October 2018). "BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding".
  10. Karlgren, Jussi; Schutze, Hinrich (2015), „Evaluating Learning Language Representations“, International Conference of the Cross-Language Evaluation Forum, Lecture Notes in Computer Science, Springer International Publishing, pp. 254–260, , ISBN 978-3-319-64205-5
  11. Devlin, Jacob; Chang, Ming-Wei; Lee, Kenton; Toutanova, Kristina (10 October 2018). "BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding".
  12. Hendrycks, Dan, Measuring Massive Multitask Language Understanding, https://github.com/hendrycks/test. წაკითხვის თარიღი: 2023-03-15
  13. The Corpus of Linguistic Acceptability (CoLA). დაარქივებულია ორიგინალიდან — 7 December 2020. ციტირების თარიღი: 2019-02-25
  14. GLUE Benchmark en. დაარქივებულია ორიგინალიდან — 4 November 2020. ციტირების თარიღი: 2019-02-25
  15. Microsoft Research Paraphrase Corpus en-us. დაარქივებულია ორიგინალიდან — 25 October 2020. ციტირების თარიღი: 2019-02-25
  16. MultiNLI. ციტირების თარიღი: 2026-05-09
  17. Aghaebrahimian, Ahmad, Text, Speech, and Dialogue
  18. Sammons, V.G.Vinod Vydiswaran, Dan Roth, Mark; Vydiswaran, V.G.; Roth, Dan. Recognizing Textual Entailment. დაარქივებულია ორიგინალიდან — 9 August 2017. ციტირების თარიღი: February 24, 2019
  19. The Stanford Question Answering Dataset. დაარქივებულია ორიგინალიდან — 30 October 2020. ციტირების თარიღი: 2019-02-25
  20. Recursive Deep Models for Semantic Compositionality Over a Sentiment Treebank. დაარქივებულია ორიგინალიდან — 27 October 2020. ციტირების თარიღი: 2019-02-25
  21. llama/MODEL_CARD.md at main · meta-llama/llama en. ციტირების თარიღი: 2024-12-28