Міністерство цифрової трансформації України представило новий 59-сторінковий документ, що містить рекомендації для розробників продуктів із штучним інтелектом. В його створенні взяли участь 15 фахівців у галузі юриспруденції та розвитку ШІ.
Цей посібник орієнтований на українську ІТ-спільноту, яка вже інтегрує великі мовні моделі або бажає запровадити генеративний ШІ у свої продукти. Цю інформацію було надано в прес-релізі Мінцифри.
Рекомендації спрямовані на підтримку розробників у створенні безпечних, прозорих та етично обґрунтованих рішень. У документі розглядається, як уникнути упередженості в даних та відповідях, дотримуватися нових європейських норм щодо регуляції ШІ та захищати права людини. Окремо підкреслюється, на яких даних варто навчати моделі та якими критеріями керуватися під час вибору.
Дані для навчання
Розробникам рекомендується уважно перевіряти, з якими даними вони працюють. Документ приділяє особливу увагу якості датасетів для машинного навчання. Перед тим як використовувати дані для навчання моделі, важливо переконатися, що вони легально доступні (за ліцензією або з дозволом), збалансовані та нормалізовані. Наскрізь слід формувати метадані, які містять інформацію про джерела, структуру і умови використання.
Недотримання цих вимог може призвести до помилок у моделях. Наприклад, класифікатор може давати некоректні результати, а генеративна модель — продукувати “галюцинації” або упереджені відповіді, що можуть дискримінувати певні групи.
Щоб уникнути проблем із якістю даних, документ згадує популярні інструменти, такі як бібліотеки Python (Seaborn, Pandas Profiling), Microsoft Azure, Amazon AWS та Google Cloud, які допомагають виявляти аномалії, пропущені значення та дисбаланс класів.
Як навчати моделі
Другий розділ рекомендацій зосереджений на процесах навчання моделей машинного навчання. Виділяються три основні методи:
- Навчання з учителем — модель навчається на розмічених даних, де існує чіткий зв’язок між вхідними та вихідними значеннями. Це підходить для задач, таких як класифікація та розпізнавання.
- Навчання без учителя — дані не мають міток, і модель самостійно визначає закономірності. Використовується для кластеризації і виявлення аномалій.
- Навчання з підкріпленням — агент отримує винаради або покарання в середовищі. Цей метод ефективний у сценаріях, що вимагають серії рішень, наприклад, в робототехніці або іграх. Однак тут модель може «навчитися» догоджати користувачу, ігноруючи об’єктивність відповідей.
Для великих мовних моделей, таких як ChatGPT, зазвичай застосовують комбінацію цих підходів. Спершу модель навчають без учителя, щоб охопити загальні мовні закономірності, а потім переходять до навчання з підкріпленням на основі людського зворотного зв’язку.
Документ також окреслює, коли доцільно використовувати тонке налаштування (fine-tuning). Цей метод стає актуальним, коли потрібно адаптувати модель під конкретну термінологію, стиль або предметну область. Для цього слід мати якісний набір “запит— відповідь”. Однак варто пам’ятати, що тонко налаштовані моделі можуть бути дорожчими в експлуатації, що може бути недоцільно для певних розробників.
Як обрати велику мовну модель
Фахівці радять при виборі моделі звертати увагу не лише на її розмір і швидкість, а й на менш очевидні фактори, такі як якість навчальних даних, контекстне вікно, тип моделі та прозорість API.
Зазначається, що більшість моделей навчаються на відкритих даних з мережі, які не завжди надійні. Джерела інформації не розкриваються, що може призводити до ризикуючих дезінформацією і упередженими результатами.
Розробникам рекомендується звертати увагу на:
- Контекстне вікно — це кількість токенів, які модель «пам’ятає» одночасно. Якщо вікно обмежене, модель може втратити важливу інформацію під час довгих діалогів або в обсягах документів.
- Кількість параметрів — чим більше параметрів, тим вища потужність моделі, але це не завжди означає кращу якість. Важливими є архітектура, навчальні дані та методи навчання.
Моделі умовно поділяються на три типи:
- Стандартні — універсальні, наприклад, GPT-4.
- Змірковані — кращі для розв’язання складних логічних завдань.
- Гібридні — такі, як Claude Sonnet, які об’єднують швидкість і дедуктивні навички.
Для оцінки моделей варто використовувати бенчмарки, такі як Chatbot Arena, Hugging Face, MLPerf та тестові платформи — OpenAI Playground, Anthropic Console, Azure Foundry. Вони дозволяють експериментувати з параметрами мовної моделі.
Також важливо звертати увагу на інтерфейси доступу, політику конфіденційності та умови використання.
Права людини
У рекомендаціях окреслено ключові ризики, які можуть виникати на різних етапах розробки та впровадження ШІ. Це стосується випадків, коли алгоритми можуть загрожувати людям. Наприклад:
- У медичних системах помилкові дані можуть загрожувати життю пацієнтів.
- У HR-системах алгоритми можуть поглиблювати дискримінацію.
- У фінансових продуктах може бути відмова в кредиті без можливості оскарження.
- У модерації контенту можуть цензурувати законні висловлювання.
Моделі можуть вплинути на свободу думок, релігію, право на власність, соціальні послуги та участь у культурному житті. Щоб уникнути негативних наслідків, розробникам рекомендується використовувати інструмент HUDERIA, розроблений Радою Європи. Ця методологія допомагає оцінити AI-продукти на відповідність правам людини, демократії та верховенству права. Також важливо залучати зацікавлені сторони — представників тих груп, на які система може вплинути.
Інші питання
Додаткові блоки присвячені авторському праву, захисту персональних даних та антимонопольним ризикам:
- Авторське право пояснює, як працювати з навчальними даними та згенерованим контентом, щоб не порушувати чужі права. Він допомагає зрозуміти, які дані можна використовувати, за яких умов, і кому належать результати генерації — користувачу, компанії чи творцю моделі.
- Захист персональних даних орієнтований на відповідальну обробку чутливої інформації користувачів. Він дає вказівки щодо правових підстав, необхідних для впровадження захисту даних, а також оцінки ризиків для приватності до запуску продукту, враховуючи норми GDPR і інші аспекти європейського законодавства.
- Антимонопольні ризики звертають увагу на технологічну залежність від великих постачальників рішень ШІ. Залежність від одного API чи моделі може створювати ризики, що розробники опиняться без доступу або стикаються з несподіваними змінами правил.
Детальніше ознайомитися з кожним із цих блоків можна у вищезгаданих рекомендаціях.
Нагадуємо, що Україна інтегрувалась у Рамкову конвенцію Ради Європи щодо штучного інтелекту, прав людини, демократії та верховенства права. У майбутньому законодавство України у сфері ШІ спиратиметься на принципи цієї конвенції, що також сприятиме інтеграції України в європейську правову систему.
