Передумови створення морфологічних процесорів (стр. 2 из 3)

Дві морфеми, що містять різну інформацію, можуть графічно співпадати (повністю або частково) одна з одною. Ми ж роздивимося лише такі випадки співпадання, коли принаймні одна з морфем повністю входить до складу іншої. Решта випадків співпадання не впливають на правильність морфологічного аналізу й тому нас не цікавлять.

Як приклад повної вкладеності одної морфеми в іншу можна навести суфікс –ами (ор. відм. мн.), що повністю вкладається в основу намист- слова намисто, що призводить до неправильного розкладу н-ами-ст-о

Особливо важливі два приватних випадки співпадання морфем.

а) Дві морфеми повністю співпадають. Такі морфеми називаються омонімічними.

б) Одна з морфем входить до складу іншої, і при цьому існує деяка одиниця, що починається з меншої морфеми, але дозволяє вкладення і більшої (тої, що включає) морфеми. Тоді ми кажемо, що ці морфеми спряжені одна з одною.

Вкладення одних морфем у інші, і, зокрема омонімія та спряженість морфем створюють певні труднощі морфологічного аналізу.

Основні моменти

У процесі морфологічного аналізу легко виділяються такі основні моменти, що є спільними для різних мов та алгоритмів:

1. Пошук словоформи (або залишку) в певних списках морфем (у таблицях). Під пошуком мається на увазі послідовне порівняння текстової одиниці (словоформи або залишку) з елементами списку (з основами, префіксами або суфіксами) доти, доки елемент списку політерно не “вкладеться” зліва направо до текстової одиниці, що обробляється.

2. Вибір потрібного елемента з кількох можливих. Тут мається на увазі випадок, коли до текстової одиниці одночасно можуть вкладатися різні морфеми (омонімічні або спряжені). Необхідний вибір робиться на основі спеціальних поміток, що приписані морфемам та відображають їхню сполучність. Так, за допомогою поміток при основі обирається правильний суфікс (із декількох, що вкладаються до цього закінчення); при розтинанні залишку на суфікси може бути виправлено помилку, що її припустилися раніше (під час відтинання основи) і т.д.

3. Вибір інформацій до окремих морфем та об`єднання цих інформацій у загальну інформацію до словоформи, що аналізується.

4. Виявлення індивідуальних особливостей морфем (якщо такі особливості є) та врахування впливу цих особливостей на загальну інформацію до словоформи.

5. Вибір подальших дій після того, як завершено обробку наступної морфеми. Послідовність дій зазвичай визначається властивостями щойно обробленої морфеми.

Конкретний зміст цих п`яти основних моментів морфологічного аналізу змінюється в залежності від алгоритму, але самі ці моменти залишаються в принципі незмінними. Не обов`язково всі п`ять моментів мають місце: другий та четвертий можуть взагалі бути відсутні (наприклад, у мові, де немає морфем, що співпадають і де морфеми не мають індивідуальних особливостей). Важливо лише те, що для опису морфологічного аналізу вищенаведених моментів досить.

Найбільш складним із вказаних моментів морфологічного аналізу є другий – обрання потрібної морфеми у випадку омонімії, повної вкладеності та спряженості морфем. Якби в мовах не було всіх цих “небезпечних ” спів падань морфем, то морфологічний аналіз здійснювався б кількома стандартними, надзвичайно простими операціями. Взагалі, головна скланість автоматичного перекладу в цілому – це зовнішнє (в даному випадку, графічне) співпадання мовних елементів, що по-різному перекладаються й тому містять різну інформацію. Таке спів падання призводить до задачі розрізняння та вибору, без якої аналіз під час автоматичного перекладу зводився б до елементарних перетворень.

Природно. що проблема омонімії (в найширшому розумінні терміна), тобто задача розрізняння та вибору, посідає важливе місце в морфологічному аналізі. Морфологічний аналіз має забезпечувати правильний розбір таких випадків співпадання, які принципово (людиною) можуть бути проаналізовані під час розгляду ізольованих словоформ, без звертання до контексту. Повинно правильно розкладатися співпадання окремих морфем за умови, що не співпадають цілі словоформи. Не можуть і не повинні однозначного розкладатися випадки, коли має місце повне співпадання словоформ. Вважається за достатнє, коли всі такі випадки буде якимось чином виділено для подальшого розкладу.

Основні моменти морфологічного аналізу, що наведені вище, мають такий загальний характер, що самі по собі вони є тривіальними. Однак вони дозволяють мислити весь процес морфологічного аналізу чітко та компактно, хоча й у загальному вигляді. Для практичної розробки морфологічного аналізу ці основні моменти необхідно конкретизувати, точно описавши окремі алгоритми, за допомогою яких вони будуть здійснюватися і які всі разом складуть алгоритм морфологічного аналізу. Необхідно побудувати якийсь загальний алгоритм морфологічного аналізу, або розробити таку загальну форму для алгоритмів морфологічного аналізу, яка виявиться достатньою (хоча деколи й надто розширеною) для багатьох мов, що вже існують, а також теоретично можуть існувати.

Нижче описано один із можливих варіантів такого загального алгоритму морфологічного аналізу.

Однак слід мати на увазі, що загальну схему морфологічного аналізу викладено тут не повністю. Річ у тім, що, хоча пошук словоформ у словнику основ принципово не відрізняється від пошуку залишків у таблиці суфіксів, пошук у словнику основ являє собою певною мірою самостійну задачу. Це пов`язано з численністю основ. Великий обсяг словника основ (порівняно до таблиць суфіксів) зумовлює специфічні умови пошуку в ньому, вилучення інформації тощо. Тому вважається за доцільне умовно поділити морфологічний аналіз на два алгоритми: “Пошук у словнику основ” та “Власне морфологічний аналіз”. Тут взагалі не розглядається перший алгоритм. Не розглядається також відтинання префіксів, оскільки воно тісно пов`язане з пошуком у словнику основ і є

розділом цієї частини аналізу. Мова йде про морфологічний аналіз з того моменту, коли від словоформи вже відділені префікси та одна основа. Маємо на увазі морфологічний аналіз відповідного залишку і вважаємо, що ми маємо словарну інформацію про основу, що відітнули (а також про префікси, якщо вони були).

Загальний вигляд алгоритму морфологічного аналізу

В загальному вигляді алгоритм морфологічного аналізу (без пошуку в словнику основ) складається з п`яти частин.

1. Частина А – “Загальні правила” – є основною частиною алгоритму (власне алгоритмом) і являє собою набір правил, що визначають послідовність операцій та взаємодію решти частин.

2. Частина Б – “Список суфіксів” – містить перелік суфіксів даної мови разом із деякими вказівками, що необхідні для їх правильної обробки (“допоміжними інформаціями”).

3. Частина В – “Список інформацій до суфіксів” (інакше – “Стандартний запис”), містить перелік “основних інформацій” до тих суфіксів, що містяться у частині Б (під “основною інформацію до суфіксу” мається на увазі та інформація, що її має бути перенесено до інформації до словоформи).

4. Частина Г – “Нестандартний запис” – є набором вказівок про індивідуальні особливості суфіксів співвідносно до особливостей основ а також про те, як ці особливості мають бути враховані.

5. Частина Д – це таблиця, де перераховано випадки, коли повністю співпадають деякі форми від різних основ (при тому, що інші форми від цих слів – різні).

П`яти частин, що наведені вище, достатньо для представлення алгоритму морфологічного аналізу цілої низки мов. Частини А, Б, та В необхідні; частини Г та Д можуть бути відсутні.

Частини алгоритму можуть поділятися на розділи.

Перейдемо до опису внутрішньої будови частин алгоритму.

Внутрішня будова алгоритму

Частина А – “Загальні правила”

Частина А являє собою певну послідовність правил, що викладені в термінах так званих алгоритмічних операторів. Оператор – це стандартна частина алгоритму, що повторюється, для якої можна створити стандартну програму реалізації.

Частина А складається з десяти розділів; серед них розділи І. ІІІ, V та VI є обов`язковими для будь-якого алгоритму, а решта розділів може бути відсутня.

Кожний розділ має виконувати певну змістовну задачу, і його робота завжди призводить до певного результату. Для всіх розділів визначено, які результати (умовно) вважати позитивними, а які – негативними. Для кожного розділу також вказується , куди слід переходити у випадку того чи іншого результату.

Отже, частина А працює таким чином:

1. Під час морфологічного аналізу окремих словоформ відрізняють обробку “нормальних” випадків (розділи II-VI) та “особливих” випадків (розділи VII-X). “Нормальні” випадки – це словоформи, для яких було знайдено правильну основу та залишки яких (якщо залишки є) складаються лише із суфіксів, при цьому в цих суфіксах не мають місце графічні чергування. До “нормальних” випадків належать більшість словоформ тексту в таких мовах, як українська, російська, англійська, французька, угорська та ін. “Особливі” випадки – це або словоформи, для яких знайдено помилкову основу (внаслідок омонімії або спряженості основ), або словоформи із залишками, що містять, окрім суфіксів, ще й основу (“складні слова”), або словоформи, що мають графічні чергування в суфіксах. Словоформи, що відносяться до “особливих” випадків, зазвичай становлять меншість словоформ тексту.

2. Перед початком морфологічного аналізу будь-яка словоформа вважається “нормальною” і робиться спроба виконати “нормальну” обробку цієї словоформи. В більшості випадків це вдається зробити. Якщо ж під час “нормальної” обробки словоформа виявляється “ненормальною” (тобто один з розділів дає негативний результат), її передають на “особливу” обробку. Після “особливої” обробки (помилково знайдену словоформу замінюють іншою і т. д., див. нижче п. 5) словоформа повертається на “нормальну” обробку. Таким чином, “нормальна” обробка виконується над усіма словоформами, для яких потрібен морфологічний аналіз, а “особлива” – лише над деякими.