back to top

Вчені представили українську велику мовну модель Lapa LLM: що потрібно знати

В Україні була презентована нова велика мовна модель Lapa LLM v0.1.2, адаптована для роботи з українською мовою. Розробку здійснили спеціалісти з Українського католицького університету, КПІ, Львівської політехніки та AGH University у Кракові.

Про це повідомив один із учасників проекту, аспірант УКУ Юрій Панів.

Основою нової мовної моделі є архітектура Gemma-3-12B, а її головна мета — створити швидку, точну та відкриту українську LLM, яка буде корисною для досліджень та комерційних потреб.

Модель отримала назву на честь Валентина Лапи, який є співавтором методу групового обліку аргументів, котрий став основним теоретичним фундаментом для сучасного глибокого навчання.

Що відомо про Lapa LLM

Згідно зі словами розробників, Lapa LLM виділяється тим, що токенізатор був повністю переписаний для української мови. 80 тисяч з 250 тисяч токенів було замінено, що дозволило значно підвищити ефективність обробки україномовного тексту. Це забезпечує зменшення потреби в токенах у 1,5 рази для виконання тих же завдань, що, відповідно, знижує обчислювальні витрати. За швидкістю роботи з українською вона опереджає оригінальну модель Gemma та більшість закритих аналогічних моделей, згідно з інформацією з УКУ.

В процесі тестування на бенчмарках Lapa LLM показала такі результати:

  • Переклад: модель досягла 33 BLEU на FLORES для напрямку англійська → українська, а також показала високий результат у зворотному напрямку.
  • Обробка зображень: у тестах MMZNO Lapa LLM потрапила до лідерів свого класу за точністю розпізнавання україномовних підписів та описів зображень.
  • Стиснення тексту та Q&A: продемонструвала стабільну роботу з великими текстами, зберігаючи контекст і точність у відповідях на запитання, що підходить для систем типу RAG.
  • Виявлення пропаганди: модель продемонструвала послідовність у визначенні маніпулятивних наративів та упереджених формулювань, що підтверджує високу якість фільтрації даних під час навчання.

За словами розробників, в деяких випадках вона вже наближається до MamayLM, яка вважається лідером серед українських мовних моделей. У версії 1.0 творці Lapa LLM мають намір перевершити її результати.

Команда розробників підкреслює прагнення до максимальної відкритості. На даний момент модель доступна для вільного завантаження та використання в комерційних проектах. Також анонсовано випуск вихідного коду для навчання та 25 навчальних датасетів. Перші 5 датасетів та частину коду вже доступні на сторінці проєкту, решту обіцяють опублікувати протягом тижня з моменту релізу.

Спеціалісти зазначають, що під час навчання використовували відкриті українські корпуси, оцінені за критеріями читабельності, граматики та відсутності дезінформації. На фінальних етапах навчання використовували високоякісні матеріали з бази відкритих даних Гарвардської бібліотеки.

Розробники відзначають, що Lapa LLM можна застосовувати для:

  • створення корпоративних асистентів і чат-ботів українською мовою;
  • машинного перекладу між українською та англійською;
  • розробки RAG-рішень для обробки внутрішніх документів;
  • роботи з конфіденційними текстами без передачі їх на зовнішні сервери.

В подальшому науковці планують створити версію моделі, яка включатиме функцію висновків, а також розширити корпуси для аналізу зображень і програмування.

Розробка Lapa LLM отримала підтримку від Comand.AI, ELEKS (у рамках гранту пам’яті Олексія Скрипника) та HuggingFace, який надав команді корпоративну підписку для роботи з датасетами.

Внесено уточнення в частину новини щодо статусу відкритості проєкту, зокрема фактичної доступності вихідного коду та датасетів.

Ще більше новин

Останні новини