Оцінювання надійності виклику функцій великими мовними моделями для україномовних запитів

Main Article Content

Шеремет Олексій Іванович
Томашевський Роман Сергійович
Чмихова Оксана Володимирівна
Воробйов Богдан Віталійович

Анотація

Виклик функцій великими мовними моделями дедалі частіше використовують для перетворення природномовних запитів на виклики програмних функцій, однак надійність цього процесу для україномовних запитів залишається недостатньо дослідженою. Запропоновано UA-ToolCall – парний англо-український еталонний набір із двадцятьма двомовними контрактами імітаційних функцій, двадцятьма чотирма прикладами для налагодження і ста двадцятьма зафіксованими тестовими завданнями: ста завданнями з обов’язковим викликом інструмента, десятьма завданнями на уточнення та десятьма завданнями без виклику інструмента. У ньому варіюються мова запиту, мова описів, розмір каталогу та подібність інструментів-дистракторів, тоді як машинні ідентифікатори залишаються канонічними. Моделі сімейств Qwen3, Granite 3.3 і SmolLM3 оцінено у форматі Q4_K_M за спільним текстовим промптом для одноетапного формування структурованих результатів виклику функцій без обмеженого декодування; застосовано жадібне декодування й отримано три тисячі шістсот відповідей. За англомовних описів і повного каталогу з двадцяти інструментів українські запити знизили строгу успішність із дев’яноста чотирьох до сімдесяти чотирьох відсотків, із сорока трьох до дев’яти відсотків і з двадцяти шести до дев’яти відсотків відповідно; усі парні ефекти залишилися значущими після поправки Холма. Qwen зберіг стовідсоткову точність вибору інструмента, тому його втрати були пов’язані з аргументами й канонізацією значень; Granite втрачав і вибір, і аргументи, а в SmolLM3 переважали помилки в полі рішення. Українські та двомовні описи підвищили строгу успішність SmolLM3 на одинадцять і сімнадцять відсоткових пунктів відповідно, але не дали статистично значущого приросту іншим моделям; двомовні описи збільшили середню довжину промпту на п’ятдесят чотири – вісімдесят три відсотки. За єдиного порядку каталогу, сформованого з початковим значенням 1701, жоден контраст каталогу не був статистично значущим; варіативність, зумовлену порядком інструментів, не оцінювали. Результати підтверджують доцільність окремого оцінювання семантичної та виконуваної правильності й показують, що користь від локалізації залежить від моделі. Висновки стосуються одноетапного формування структурованих результатів виклику функцій за текстовим промптом у досліджених квантизованих моделях, а не штатних інтерфейсів виклику функцій, обмеженого декодування чи багатокрокової взаємодії з інструментами.


 

Downloads

Download data is not yet available.

Article Details

Розділ

Інформатика та інтелектуальні інформаційні технології

Біографії авторів

автор Шеремет Олексій Іванович, афіліація Донбаська державної машинобудівна академія, вул. Академічна, 72. Краматорськ, 84313, Україна

доктор технічних наук, професор, завідувач кафедри Електроінженерії та відновлювальної енергетики. 

Scopus Author ID: 57170410800

автор Томашевський Роман Сергійович, афіліація Донбаська державна машинобудівна академія, вул. Академічна, 72. Краматорськ, 84313, Україна

доктор технічних наук, професор, в. о. ректора

Scopus Author ID: 56338488300

автор Чмихова Оксана Володимирівна, афіліація Донбаська державна машинобудівна академія, вул. Академічна, 72. Краматорськ, 84313, Україна

кандидат технічних наук, доцент, перша проректорка та проректорка з науково-педагогічної та методичної роботи

Scopus Author ID: 57194619495

автор Воробйов Богдан Віталійович, афіліація Донбаська державна машинобудівна академія, вул. Академічна, 72. Краматорськ, 84313, Україна

доктор філософії (PhD), доцент, проректор з наукової роботи, управління розвитком та міжнародних зв’язків

Scopus Author ID: 57891861500

Як цитувати

Оцінювання надійності виклику функцій великими мовними моделями для україномовних запитів. (2026). Інформатика. Культура. Техніка, 3(1 (3), 210–220. https://doi.org/10.15276/ict.03.2026.18

Посилання