Оцінювання надійності виклику функцій великими мовними моделями для україномовних запитів
Main Article Content
Анотація
Виклик функцій великими мовними моделями дедалі частіше використовують для перетворення природномовних запитів на виклики програмних функцій, однак надійність цього процесу для україномовних запитів залишається недостатньо дослідженою. Запропоновано UA-ToolCall – парний англо-український еталонний набір із двадцятьма двомовними контрактами імітаційних функцій, двадцятьма чотирма прикладами для налагодження і ста двадцятьма зафіксованими тестовими завданнями: ста завданнями з обов’язковим викликом інструмента, десятьма завданнями на уточнення та десятьма завданнями без виклику інструмента. У ньому варіюються мова запиту, мова описів, розмір каталогу та подібність інструментів-дистракторів, тоді як машинні ідентифікатори залишаються канонічними. Моделі сімейств Qwen3, Granite 3.3 і SmolLM3 оцінено у форматі Q4_K_M за спільним текстовим промптом для одноетапного формування структурованих результатів виклику функцій без обмеженого декодування; застосовано жадібне декодування й отримано три тисячі шістсот відповідей. За англомовних описів і повного каталогу з двадцяти інструментів українські запити знизили строгу успішність із дев’яноста чотирьох до сімдесяти чотирьох відсотків, із сорока трьох до дев’яти відсотків і з двадцяти шести до дев’яти відсотків відповідно; усі парні ефекти залишилися значущими після поправки Холма. Qwen зберіг стовідсоткову точність вибору інструмента, тому його втрати були пов’язані з аргументами й канонізацією значень; Granite втрачав і вибір, і аргументи, а в SmolLM3 переважали помилки в полі рішення. Українські та двомовні описи підвищили строгу успішність SmolLM3 на одинадцять і сімнадцять відсоткових пунктів відповідно, але не дали статистично значущого приросту іншим моделям; двомовні описи збільшили середню довжину промпту на п’ятдесят чотири – вісімдесят три відсотки. За єдиного порядку каталогу, сформованого з початковим значенням 1701, жоден контраст каталогу не був статистично значущим; варіативність, зумовлену порядком інструментів, не оцінювали. Результати підтверджують доцільність окремого оцінювання семантичної та виконуваної правильності й показують, що користь від локалізації залежить від моделі. Висновки стосуються одноетапного формування структурованих результатів виклику функцій за текстовим промптом у досліджених квантизованих моделях, а не штатних інтерфейсів виклику функцій, обмеженого декодування чи багатокрокової взаємодії з інструментами.

