Міністерство цифрової трансформації започатковує оцінку великих мовних моделей за якістю української мови

Міністерство цифрової трансформації започатковує оцінку великих мовних моделей за якістю української мови 3

Фото до статті

Олександр Остапенко

Автор новин

Українські державні установи прагнуть припинити практику оцінки якості роботи нейромереж із українською мовою «на око», покладаючись на маркетингові обіцянки розробників. Відтепер країна має власний інструмент вимірювання: Ukrainian LLM Leaderboard, публічний рейтинг, що об’єктивно демонструє, наскільки добре певна модель насправді розуміє та генерує українську мову.

Міністерство цифрової трансформації започатковує оцінку великих мовних моделей за якістю української мови 4

Цю ініціативу розробив центр компетенцій WINWIN AI спільно з Українським католицьким університетом (УКУ) та мовною спільнотою lang-uk, як повідомляє сайт Мінцифри.

Проблема, яку вирішує рейтинг

Штучний інтелект вже давно перетнув межі експериментальних розробок і функціонує в численних сервісах повсякденного використання — від державних застосунків до банківських продуктів. Проте донедавна вибір моделі для інтеграції відбувався фактично навмання. Глобальні рейтинги зазвичай тестують ШІ англійською мовою, а якість роботи з українською перевірялася переважно через машинний переклад. Цей метод приховував реальні мовні похибки: калькові русизми, спотворені відмінки, а іноді й фактичні викривлення чи дезінформацію про Україну.

Новий лідерборд має на меті замінити цю сліпу довіру точними вимірюваннями.

На яких завданнях перевіряють моделі

Методологія тестування була побудована таким чином, щоб максимально наблизити її до реальних сценаріїв застосування штучного інтелекту. Моделі мають продемонструвати свою здатність до:

  • перекладу, реферування та стислого викладу великих обсягів тексту;
  • пошуку відповідей у документах та розв’язання логічних задач;
  • створення тестів рівня шкільної програми, порівнянних за складністю зі ЗНО;
  • виконання математичних обчислень та точного дотримання складних інструкцій.

Усі результати тестування, вихідний код та масиви даних є загальнодоступними на платформі HuggingFace — кожен зацікавлений може самостійно порівняти моделі та перевірити, яким чином проводився розрахунок оцінок.

Хто стоїть за методологією

Розробкою правил оцінювання займалася команда фахівців УКУ та спільноти lang-uk, зокрема Юрій Панів і Дмитро Чаплінський, які понад десять років працюють над навчанням нейромереж розумінню української мови. Саме ця команда формує текстові масиви та створює інструменти, що згодом використовуються розробниками по всій країні. Підхід вже має практичний досвід: його застосовували під час розробки української мовної моделі Lapa LLM, а результати були представлені на міжнародних наукових конференціях.

Юрій Панів, аспірант УКУ та керівник розробки мовної моделі Lapa, пояснює мотивацію проєкту так: до появи великих мовних моделей залишалося незрозумілим, наскільки ефективно вони працюють з українською — де їхні сильні сторони, а де слабкі місця, і яка модель краще підходить для певних завдань. Мета лідерборду — надати відповіді на ці запитання, об’єднавши наявні бенчмарки української NLP-спільноти з новими розробками, щоб допомогти як бізнесу у виборі моделей, так і дослідникам у їхній роботі.

Chief AI Officer WINWIN AI Center of Excellence Роман Кислий формулює логіку проєкту ще прямолінійніше: неможливо керувати процесами, які не вимірюються. Оскільки ШІ вже інтегрується в сервіси для мільйонів людей, рішення мають ґрунтуватися на доказах, а не на обіцянках — і лідерборд перетворює якість роботи моделі з українською мовою на публічний і перевірюваний факт.

Практична користь для держави, бізнесу та науки

Новий інструмент вирішує одразу три завдання. Держава отримує надійну базу даних для вибору технологічних рішень під час інтеграції ШІ в державні сервіси. Бізнес може об’єктивно оцінити рентабельність впровадження тієї чи іншої моделі ще до підписання контракту. Дослідницька спільнота, натомість, отримує єдину систему координат для порівняння результатів своєї діяльності.

Плани на розвиток платформи

Команда не зупиняється на поточній версії лідерборду й планує розширювати його функціонал. Серед найближчих напрямків — додавання перевірки роботи моделей із зображеннями, оцінка етичності відповідей та аналіз вартості використання штучного інтелекту українською мовою. Окрему увагу розробники обіцяють приділити потребам державного сектору: наскільки коректно моделі опрацьовують адміністративні процедури та нормативні тексти, а також чи безпечно вони працюють з персональними даними громадян.

Переглянути поточний рейтинг і протестувати моделі можна на платформі HuggingFace.

Нагадаємо, нещодавно стало відомо, що українська мова демонструє лідерство за темпами поширення в LLM-моделях.

Головна > Новини > Мінцифра запускає рейтинг LLM-моделей за рівнем володіння українською мовою

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *