Компанія Mistral представила новий інтерфейс програмування додатків (API) для оптичного розпізнавання символів (OCR) в четвер. Цей штучний інтелект (ШІ) може аналізувати та обробляти PDF-документи, перетворюючи їх у текстовий формат, підготовлений для ШІ, наприклад, Markdown або чистий текстовий файл. Інструмент здатен витягувати дані з PDF, щоб зробити їх зрозумілими для моделей ШІ. Парижська компанія стверджує, що Mistral OCR API дозволить розробникам створювати додатки ШІ для роботи з PDF-файлами, а також створювати набори даних для навчання нових моделей ШІ.
Представлення Mistral OCR API
PDF-документи є унікальною проблемою для моделей ШІ. Контент у цьому форматі не може бути доступний великим мовним моделям (LLM) за допомогою традиційних методів, таких як Retrieval-Augmented Generation (RAG), оскільки дані не обробляються. Наприклад, якщо ви попросите ШІ-додаток переглянути PDF-документи на вашому ноутбуці для пошуку певної інформації, він може стикнутися з труднощами у цьому.
Це означає, що розробники, які працюють над AI-додатками, будуть обмежені в можливістю пропонувати функції аналізу PDF. Хоча такі продукти, як NotebookLM від Google, AI-асистент від Adobe та кілька інших, використовують спеціалізовані OCR-інструменти для подолання цієї проблеми, розробники з відкритого коду не мають доступу до високоефективного інструменту.
Mistral OCR API вирішує цю задачу, дозволяючи розробникам витягувати дані з PDF у формат, готовий до використання в ШІ. Компанія стверджує, що інструмент може розуміти окремі елементи в документах, включаючи медіа, текст, таблиці та рівняння з високою точністю. Після аналізу він може витягувати та представляти інформацію у форматі Markdown або простого текстового файлу.
Моделі ШІ можуть використовувати цей витягнений текст як вхідні дані, а системи RAG можуть легко отримувати до них доступ та відповідати на запити. “Mistral OCR відзначається своєю здатністю розуміти складні елементи документів, включаючи переплетені зображення, математичні вирази, таблиці та складні макети, такі як форматування LaTeX. Модель дозволяє глибше зрозуміти багатошарові документи, такі як наукові статті з графіками, діаграмами, рівняннями та малюнками,” – йдеться в прес-релізі.
Компанія повідомляє, що Mistral OCR може обробляти до 2000 сторінок за хвилину на одному вузлі. API також дозволяє розробникам використовувати документ як запит та пов’язувати вихідні дані для створення інструментів виклику функцій і ШІ-агентів.
На основі внутрішніх тестів, Mistral OCR перевершив моделі, такі як Google Document AI, Azure OCR та GPT-4 версії 2024-11-20 для документів, що містять лише текст. Він також виявився переважнішим за Google та Azure в мультимовних можливостях.
Ті, хто зацікавлений у перевірці можливостей моделі, можуть відвідати платформу Mistral’s Le Chat. API доступний з la Plateforme.
