Багатокритеріальний вибір альтернатив кластеризації текстових даних за Silhouette та bootstrap-стабільністю
Main Article Content
Анотація
У роботі досліджено проблему вибору альтернатив кластеризації текстових даних за умов, коли оцінювання результату лише за одним внутрішнім критерієм не дає повного уявлення про властивості сформованого розбиття. Значення Silhouette характеризує компактність і відокремленість кластерів, однак не відображає відтворюваність отриманого рішення за зміни складу вибірки. У зв’язку з цим метою дослідження є розроблення та експериментальна перевірка процедури багатокритеріального вибору альтернатив кластеризації текстових даних на основі спільного врахування Silhouette та bootstrap-стабільності. Стабільність визначається за допомогою повторних bootstrap-вибірок і порівняння сформованих розбиттів із базовим результатом за Adjusted Rand Index. Для узгодження двох критеріїв використано Pareto-аналіз, що дає змогу виділити множину компромісних альтернатив без введення довільних вагових коефіцієнтів. Експериментальну перевірку виконано на тематичному корпусі, сформованому на основі відкритого набору новинних текстів British Broadcasting Corporation, із використанням алгоритмів KMeans та агломеративної кластеризації Ward. Встановлено, що Silhouette та bootstrap-стабільність формують різні ранжування кластерних альтернатив. Для KMeans найбільше значення Silhouette отримано за десяти кластерів, тоді як максимальна bootstrap-стабільність спостерігалася за п’яти кластерів. Для Ward конфігурації з максимальними значеннями Silhouette, стабільності та зовнішньої якості також не збігалися. Це показує, що bootstrap-стабільність не може розглядатися як універсальний критерій правильності кластеризації, але надає додаткову інформацію про відтворюваність кластерного рішення. Застосування Pareto-домінування за Silhouette та bootstrap-стабільністю дало змогу скоротити початкову множину з вісімнадцяти альтернатив до трьох недомінованих конфігурацій, тобто більш ніж на вісімдесят три відсотки. Еталонні тематичні мітки не використовувалися під час формування Pareto-множини та не входили до критеріїв багатокритеріального відбору; вони застосовувалися лише для зовнішнього оцінювання отриманих конфігурацій. Отримані результати підтверджують доцільність спільного аналізу внутрішньої геометричної якості та відтворюваності під час вибору альтернатив кластеризації текстових даних.

