Електронна бібліотека Житомирського державного університету

Determining the Morphological Class of a Word During the Automatic Natural Language Processing

Гирин О. В. (2023) Determining the Morphological Class of a Word During the Automatic Natural Language Processing. Вісник Житомирського державного університету імені Івана Франка. Філологічні науки. № 99. С. 75–82. ISSN 2663-7642. DOI: 10.35433/philology.1(99).2023.75-82.

[thumbnail of 8.pdf]
Preview
Текст
8.pdf

Завантажити (764kB) | Preview

Анотація

У статті розглянуто обов’язкову складову лінгвістичного забезпечення будь-якої системи автоматичної обробки природної мови – автоматичний морфологічний аналіз, до завдань якого входять: визначення для кожної одиниці тексту місця вморфологічній системі відповідної мови, ідентифікація словоформ однієї лексеми.

Унаслідок автоматичного морфологічного аналізу кожній словоформі тексту приписується код частини мови та значення граматичних категорій (рід, число, відмінок, вид, час, особа тощо). Характер цієї інформації, обсяг її й методи, за допомогою яких установлюють морфологічну інформацію, залежать від мети дослідження, у межах якого здійснюється автоматичний аналіз, від орієнтації на характер аналізованих текстів. Морфологічний аналіз наявний на всіх етапах аналізу тексту, тому що ані морфемний, ані синтаксичний, ані семантичний аналізи не можуть обійтися без визначення частин мови. У процесі автоматичного синтаксичного аналізу лише за наявності лексико-граматичної та граматичної інформації до кожної словоформи можна синтаксично прив’язати словоформи в реченні.

Морфологічні ознаки одиниць тексту далі стають інструментом дослідження зв’язку між лексикою та граматикою із їх використанням у мовленні, між парадигматикою (в аспекті розгляду відмінкових форм відмінюваних слів) і синтагматикою (в аспекті лінійних зв’язків слів, сполучуваності в тексті). У статті розглянуто труднощі, що заважають уніфікувати процес тегування одиниць тексту, а саме лексико-граматична омонімія, неоднозначність граматичних форм, полісемія.

У статті проаналізовано підходи до вирішення морфологічної неоднозначності, засновані на аналізі контексту неоднозначного слова, які поділяють на статистичні й такі, що визначаються правилами (rulebased). Правила можуть складатися вручну або виводитися з розмічених корпусів. Статистичні методи ґрунтуються на кількісних показниках у великих розмічених корпусах. Методи вирішення морфологічної неоднозначності застосовуються зазвичай після первинного тегування, що виконується, як правило, за допомогою словників.

У статті також наведено алгоритм морфемного аналізу для здійснення автоматичного морфологічного аналізу.

Тип ресурсу: Стаття
Класифікатор: P Мова та Література > P Філологія. Лінгвістика
Відділи: Інститут іноземної філології > Кафедра міжкультурної комунікації та іншомовної освіти
Користувач: Олександр Сергійович Яценко
Дата подачі: 07 Черв 2023 23:59
Оновлення: 08 Черв 2023 00:07
URI: https://eprints.zu.edu.ua/id/eprint/37016
ДСТУ 8302:2015: Гирин О. В. Determining the Morphological Class of a Word During the Automatic Natural Language Processing. Вісник Житомирського державного університету імені Івана Франка. Філологічні науки. 2023. № 99. С. 75–82. DOI: 10.35433/philology.1(99).2023.75-82.

Дії ​​(потрібно ввійти)

Оглянути опис ресурсу
Оглянути опис ресурсу