top of page

Мінцифри запустило рейтинг ШІ-моделей за рівнем володіння українською

Мінцифри запустило рейтинг ШІ-моделей за рівнем володіння українською

Мінцифри запустило Ukrainian LLM Leaderboard для оцінювання роботи великих мовних моделей українською. Платформа тестує переклад, роботу з документами, логіку та інші завдання. Над проєктом працювали WINWIN AI, Український католицький університет і lang-uk.


Наскільки добре ШІ насправді працює українською


Більшість глобальних рейтингів ШІ орієнтувалися насамперед на англійську мову. Українську в таких тестах могли перевіряти через машинний переклад.


Мінцифри вважає, що такий підхід приховував реальні помилки моделей. Новий рейтинг має дати окрему систему оцінювання саме для української мови.


Ukrainian LLM Leaderboard створили як відкриту платформу, яка дозволяє порівнювати здатність великих мовних моделей виконувати різні завдання українською.

За словами Юрія Паніва, аспіранта УКУ та керівника розробки Lapa, після появи великих мовних моделей бракувало розуміння якості їхньої роботи українською. Команда прагнула визначити сильні та слабкі сторони моделей, а також завдання, для яких вони підходять найкраще.


Моделі перевіряють на перекладі, математиці та завданнях рівня ЗНО


Тести Ukrainian LLM Leaderboard мають максимально відтворювати реальні сценарії використання штучного інтелекту: моделі повинні перекладати, переказувати та стисло викладати великі тексти. Окремо перевіряється здатність знаходити відповіді в документах.


До тестування також входять логічні задачі та завдання зі шкільної програми на рівні ЗНО. Моделі виконують математичні обчислення та складні інструкції.


Результати, програмний код і дані платформи відкрили для громадськості на Hugging Face. Користувачі можуть самостійно порівнювати моделі та перевіряти методологію оцінювання.

Правила тестування розробили експерти УКУ та спільноти lang-uk Юрій Панів і Дмитро Чаплинський.


Кнопка для підписки на High Bar Newsletter

Тестування зображення, етичності та роботи з даними


Команда планує надалі розширювати можливості Ukrainian LLM Leaderboard. До платформи хочуть додати перевірку роботи моделей із зображеннями.


Також планується оцінювати етичність та вартість використання ШІ українською.


Окремий напрям стосуватиметься державного сектору — розробники перевірятимуть роботу моделей з адміністративними процедурами та нормативними текстами.


Разом з тим команда оцінить і безпечність роботи ШІ з персональними даними.


«Неможливо керувати процесами, які ти не вимірюєш», — наголосив Роман Кислий, Chief AI Officer у WINWIN AI Center of Excellence.

За його словами, використання ШІ в державних сервісах потребує рішень, заснованих на доказах.

© 2035 by Business Name. Made with Wix Studio™

bottom of page