Filologiya va pedagogika Maqola yuborish

O‘zbek tilidagi savol-javob tizimlari uchun morfologik segmentatsiya va normalizatsiya muammolari

Tashkilot
Namangan davlat pedagogika instituti filologiya fanlari bo‘yicha falsafa doktori
Filologiya va pedagogika — 17 (36), 2026

Annotatsiya

Ushbu maqolada agglyutinativ tillar, xususan, o‘zbek tili uchun intellektual savol-javob (QA) tizimlarini yaratishda yuzaga keladigan morfologik segmentatsiya va normalizatsiya muammolari tadqiq etiladi. O‘zbek tilining boy affiksatsiya tizimi sababli bitta o‘zakdan son-sanoqsiz so‘z shakllarining hosil bo‘lishi lug‘at inflyatsiyasiga hamda tanib olinmaydigan so‘z shakllari (Out-of-Vocabulary – OOV) darajasining oshib ketishiga olib kelishi ko‘rsatilgan. Tadqiqotda ushbu muammolarni bartaraf etish maqsadida qoidalarga asoslangan (rule-based) lemmalash algoritmlari va chuqur o‘rganishga asoslangan neyron tarmoq modellari (UzRoBERTa) integratsiyasiga tayangan 3 bosqichli gibrid arxitektura konsepsiyasi taklif etiladi.

Kalit so'zlar

savol-javob tizimi morfologik segmentatsiya normalizatsiya agglyutinativ til tabiiy tilni qayta ishlash lemmalash gibrid model

Annotatsiya · English
This article investigates the problems of morphological segmentation and normalization that arise when developing intelligent question answering (QA) systems for agglutinative languages, particularly Uzbek. It is demonstrated that the generation of countless word forms from a single root – due to the rich affixation system of the Uzbek language – leads to vocabulary inflation and an increased rate of out-of-vocabulary (OOV) word forms. To address these issues, the study proposes a 3-stage hybrid architecture concept based on the integration of rule-based lemmatization algorithms and deep learning-based neural network models (UzRoBERTa).

question answering systemmorphological segmentationnormalizationagglutinative languagenatural language processinglemmatizationhybrid model

Annotatsiya · Русский
В статье исследуются проблемы морфологической сегментации и нормализации, возникающие при создании интеллектуальных вопросно-ответных (QA) систем для агглютинативных языков, в частности для узбекского языка. Показано, что образование бесчисленного количества словоформ от одного корня из-за богатой системы аффиксации узбекского языка приводит к инфляции словаря и увеличению доли несловарных слов (Out-of-Vocabulary – OOV). Для решения этих проблем в исследовании предлагается концепция 3-этапной гибридной архитектуры, основанная на интеграции алгоритмов лемматизации на основе правил (rule-based) и моделей нейронных сетей на основе глубокого обучения (UzRoBERTa).

вопросно-ответная системаморфологическая сегментациянормализацияагглютинативный языкобработка естественного языкалемматизациягибридная модель


Foydalanilgan adabiyotlar

  1. Bi W. et al. TCM-VQA IoTNet: A multimodal question answering model for traditional Chinese medicine education based on IoT sensors and attention mechanisms // Computers and Electrical Engineering, 2023. – P. 108
  2. Li L.H., Zhang M., Zhang X., Meng L., Liu X. VisualBERT: A simple and performant baseline for vision and language // arXiv preprint arXiv:1908.03557, 2019
  3. Vaswani A., Shazeer N., Parmar N., Uszkoreit J., Jones L., Gomez A.N., Kaiser Ł., Polosukhin I. Attention is all you need // Advances in Neural Information Processing Systems, 2017. Vol. 30. – P. 59–68
  4. Mallat S. Arabic question answering system using deep learning and semantic normalization for educational domain // Journal of King Saud University – Computer and Information Sciences, 2022. Vol. 34 (8). – P. 20–32
  5. Budur E., Ozcelik O., Koç A., Güngör T. Question answering and information retrieval for low-resource agglutinative languages: A case study on Turkish // IEEE Access, 2021. Vol. 9. – P. 123–134
  6. Rajpurkar P., Jia R., Liang P. Know what you don’t know: Unanswerable questions for SQuAD // Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics, 2018. – P. 784–789
  7. Devlin J., Chang M.W., Lee K., Toutanova K. BERT: Pre-training of deep bidirectional transformers for language understanding // Proceedings of NAACL-HLT, 2019. – P. 4171–4186
  8. Sobirov O.O., Axrorov A. O‘zbek tili uchun transformer modellari (BERTbek va UzRoBERTa) samaradorligini qiyosiy tahlil qilish // AIP Conference Proceedings / Ilmiy axborotnoma, 2023. Vol. 4 (1). – B. 45–52
  9. Sharipov M., Sobirov O. Development of a rule-based lemmatization algorithm for the Uzbek language // International Conference on Computational Linguistics and Natural Language Processing, 2022. – P. 112–119