Багатовимірна оцінка використання великих мовних моделей у задачах узагальнення текстів
Main Article Content
Анотація
Стрімке зростання обсягів цифрових текстових даних у різних галузях, зокрема науці, медицині, бізнесі та інформаційних технологіях, зумовлює необхідність розроблення ефективних методів автоматичного узагальнення інформації. Великі мовні моделі демонструють високий потенціал для розв’язання цієї задачі завдяки здатності генерувати зв’язні, змістовні та контекстно релевантні тексти. Водночас проблема комплексного та об’єктивного оцінювання їх якості залишається недостатньо дослідженою, оскільки більшість існуючих підходів базується на обмеженому наборі метрик і не враховує багатовимірний характер якості узагальнення. Метою роботи є розроблення й апробація методики комплексного порівняння моделей у задачах автоматичного узагальнення текстів на основі дворівневої системи оцінювання, яка поєднує різні аспекти якості та ефективності. У дослідженні здійснено експериментальне оцінювання чотирьох моделей (GPT, Claude, Gemini та LLaMA) на текстах різних типів. Для забезпечення об’єктивності результатів використовувалися однакові умови генерації узагальнень, зокрема фіксовані параметри та різні довжини вихідних текстів. Оцінювання якості узагальнень здійснювалося із застосуванням комплексу метрик: ROUGE для визначення лексичної подібності, BERTScore для оцінювання семантичної відповідності, SummaC для аналізу фактичної узгодженості, а також оцінювання за допомогою мовних моделей, що імітує людське сприйняття якості тексту. Додатково враховувалися показники ефективності, зокрема час генерації узагальнень та вартість їх отримання. Отримані результати свідчать про суттєві відмінності між моделями за всіма досліджуваними критеріями. Зокрема, встановлено, що різні моделі мають спеціалізацію: одні демонструють вищу фактичну точність, інші – кращу читабельність або ефективність. Також виявлено залежність якості узагальнення від довжини тексту: коротші узагальнення характеризуються вищою фактичною узгодженістю, тоді як довші забезпечують кращу повноту та зрозумілість викладу. Отримані результати дозволяють сформулювати практичні рекомендації щодо вибору великих мовних моделей залежно від вимог конкретних прикладних задач. Запропонований підхід до багатовимірного оцінювання може бути використаний як основа для подальших досліджень у галузі обробки природної мови, зокрема для вдосконалення методів оцінювання якості та адаптації моделей до спеціалізованих предметних областей.

