Час на прочитання
9 хв
1
Оцифрування документів

Оцифрування документів: як перетворити паперовий архів на дані, з якими працює ШІ

Written by
Дата публікації
Всього переглядів
94 перегляди

Сканування – це лише перший етап оцифрування. Воно створює цифрову копію документа. Повноцінне оцифрування додає OCR, машиночитаний текст, метадані, класифікацію та зв’язки між документами, тобто перетворює архів на дані, з якими можуть працювати інформаційні системи та ШІ.

Чим оцифрування відрізняється від сканування

Сканування створює візуальну копію аркуша. Оцифрування створює дані. Це два різні проєкти з різною вартістю та різним результатом.

Параметр Сканування Оцифрування
Результат Зображення сторінки в PDF або JPEG Машиночитаний текст + метадані + класифікація
Пошук Тільки за назвою файлу Повнотекстовий, за атрибутами, семантичний
Інтеграція Файли в теці або на диску API, ERP, СЕД, база знань, ШІ-асистент
Робота ШІ Обмежена; для повнотекстового пошуку, RAG та масштабної аналітики потрібні OCR і структурування Документи одразу готові для RAG і аналітики
Вартість помилки Доведеться повторно опрацьовувати весь масив Помилка ловиться на етапі контролю якості

Практичний тест: якщо ви не можете за 10 секунд знайти всі документи, де згадуються конкретний контрагент, дата й сума – у вас скани документів, а не оцифрований архів.

Навіщо українським організаціям оцифрування саме зараз

Три причини змінилися за останні два роки, і всі три мають дату.

Держава задала масштаб. За даними Кабінету Міністрів про оцифрування архівів, з 2022 року державні архіви створили понад 105,5 млн цифрових копій документів, оцифрувавши близько 1,55 млн одиниць зберігання. Затверджена Державною архівною службою Програма зацифрування архівних інформаційних ресурсів на 2026–2030 роки ставить наступну планку: зробити понад 150 млн цифрових копій.

Правила діловодства оновилися. Наказ Мін’юсту №677/5 від 16 березня 2026 року розширив правила використання електронних підписів і печаток та уточнив процес реєстрації й підписання електронних документів. Водночас для паперових копій документів, оформлених відповідно до правил діловодства, зберігається вимога проставляти відмітку «Копія» у правому верхньому куті першого аркуша. Відсутність такої відмітки – це порушення.

З’явився державний майданчик для обкатки. У травні 2026 року Кабмін запустив дворічний експериментальний проєкт електронного документообігу документів, що містять службову інформацію. Для бізнесу це сигнал: вимоги до обміну документами з держорганами лише зростатимуть.

І окремо – ризик, якого немає в жодній західній методичці. Паперовий архів, особливо у прифронтовому регіоні, може зникнути за одну ніч. Оцифрована копія в захищеному сховищі – єдина форма страхування документальної спадщини, яка працює під час війни.

Три головні виклики оцифрування

Крихкі й пошкоджені носії

Справи 1930–1970 років часто мають ламкий папір, вигорілі чорнила, сліди вологи й пліснявий пігмент. Такі документи не можна класти під притискне скло планшетного сканера й тим більше прогоняти через потоковий подавач.

Рішення: безконтактне сканування у V-подібній колисці з малим кутом розкриття, робота в рукавичках, жорстка підкладка, окремий транспортний регламент між сховищем і скан-цехом. Швидкість тут свідомо приноситься в жертву збереженню оригіналу.

Обсяг

Мільйон аркушів – це не «великий проєкт», це операційний конвеєр. На такому обсязі вручну неможливо відстежити пропущену сторінку, дубль або переплутану справу. Без системи керування партіями, штрихкодування коробок і автоматичного звіряння кількості аркушів проєкт накопичує помилки лінійно.

Стабільність якості

Перші 10 тисяч сторінок майже завжди виходять кращими за наступні 100 тисяч. Причини прозаїчні: втома операторів, зміна освітлення, розкалібрування камери, зміна типу паперу в межах одного фонду. Контроль якості має бути вибірковим і безперервним, а не одноразовою приймальнею наприкінці.

Яке обладнання та ПЗ для цього потрібні

Клас техніки Приклади Продуктивність (за даними виробників) Для чого
Роботизовані книжкові сканери ScanRobot 2.0 MDS, Kirtas APT до 2 500 стор./год, V-колиска з розкриттям 60–100° Зшиті справи, книги, крихкі оправи — без розшивання
Планетарні (безконтактні) сканери Планетарні системи з V-колискою залежить від оператора, істотно повільніше за роботизовані Унікальні й пошкоджені документи, карти, креслення
Потокові сканери Canon DR-G2140, Fujitsu fi-8950, Kodak 140 аркушів/хв (280 зображень/хв у дуплексі) Розшиті однорідні масиви: бухгалтерія, кадрові справи
OCR і постобробка ABBYY FineReader Server, Tesseract, Azure Document Intelligence Розпізнавання тексту, витяг полів, структурування

Ключове правило вибору: техніка підбирається під стан носія, а не під бажану швидкість. Один зайвий прогін кадрової справи 1954 року через потоковий сканер коштує дорожче, ніж увесь виграш у часі.

Арифметика для попереднього планування проста: 100 тисяч сторінок – це приблизно 40 годин чистого сканування на ScanRobot за максимальної заявленої продуктивності 2 500 стор./год.

ScanRobot SR301

Оцифрування документів в Україні

Джерело: grufo

Kirtas APT 2400

Оцифрування документів в Україні

Джерело: typorama

ScanRobot® 2.0 MDS

Оцифрування документів в Україні

Джерело: treventus

DL Mini – Scanroboter

Оцифрування документів в Україні

Джерело: walternagel

Чому OCR складно розпізнає історичні українські документи

Це та частина, яку зазвичай недооцінюють у кошторисі. Постачальник обіцяє «точність 99 %» – цифру, реалістичну для чистого друкованого тексту, і недосяжну для рукописної справи 1930-х років без окремої підготовки.

Галузевий орієнтир задає Transkribus, платформа розпізнавання історичних рукописів: CER (character error rate) менше 1 % досяжний для простого друкованого тексту, а 5 % або менше – це вже дуже добрий результат для складного рукопису. Тобто для складного історичного рукопису приблизно одна помилка на 20 символів уже може вважатися дуже добрим результатом. Причини конкретні:

  1. Змішані мови в межах однієї справи. Українська, російська, польська, німецька, ідиш, латина – типовий набір для західноукраїнських фондів. Одна універсальна OCR-модель для всього масиву часто дає нижчу точність, тому різні мови, періоди й типи письма можуть потребувати окремого налаштування або донавчання.
  2. Дореформена орфографія та ярижка. Літери ѣ, і, ъ, ы у текстах до 1920-х років ламають словники сучасних моделей.
  3. Рукописний скоропис. Метричні книги, протоколи, особові справи — це не друкований текст. Тут потрібні окремі HTR-моделі (handwritten text recognition), а не класичний OCR.
  4. Друкарські машинки з нерівномірним відбитком. Радянське діловодство 1950–1980-х: бліді копії через копіювальний папір, зміщені літери, накладення штампів на текст.
  5. Гербові печатки й штампи поверх тексту. Без попереднього видалення штампу модель читає закритий рядок як шум.

Практичний висновок: закладайте у проєкт етап донавчання моделі на вашому власному масиві. Моделі, натреновані на понад 100 000 слів, починають розпізнавати навіть незнайомі почерки. Для архівного фонду з десятками писарських рук це означає окремий бюджет на розмітку.

Кому оцифрування дає найбільший ефект

  • Державні установи та органи місцевого самоврядування: архіви рішень, земельні справи, звернення громадян, надання послуг через ЦНАП без пошуку паперу в підвалі.
  • Медичні заклади: паперові амбулаторні карти, які потрібно звести з електронною системою охорони здоров’я.
  • Енергетика, надра та геологія: технічна документація, звіти, каротажні діаграми, проєктна документація об’єктів, побудованих 40 років тому.
  • Освіта й наука: фонди бібліотек, дисертації, архів кафедри, оцінювання й дипломи.
  • Фінансовий сектор: кредитні справи, договори, документи з тривалими строками зберігання.
  • Юридичні компанії та нотаріат: справи, договори, довіреності, де важливий не сам документ, а швидкий доступ до конкретного пункту.

Спільна риса: у всіх шести випадках цінність не в самому скані, а в тому, що документ стає елементом робочого процесу, від автоматизації бізнес-процесів до відкритих даних міста.

Що саме робить ШІ на кожному етапі

1. Розпізнавання структури документа Модель бачить, де заголовок, де таблиця, де підпис, де маргіналія, і зберігає цю ієрархію.
2. Покращення зображення Усунення тіней від згину, вирівнювання геометрії, підвищення контрасту вигорілого тексту, видалення фону й проступання зі звороту.
3. OCR і розпізнавання рукопису Базове розпізнавання плюс моделі HTR для скоропису.
4.  Інтелектуальна класифікація Автоматичне визначення типу документа (наказ, договір, акт, протокол) і маршрутизація до відповідного розділу архіву.
5. Семантичне тегування через NLP Витяг сутностей: прізвища, організації, дати, номери, суми, локації. Саме це перетворює текст на дані, за якими можна фільтрувати.
6. Автоматичний контроль якості Модель автоматично позначає сторінки з низькою впевненістю розпізнавання, а оператор перевіряє їх разом зі статистичною вибіркою решти масиву.

Порахуємо ваш потенційний бюджет

Допоможемо оцінити проєкт і скласти поетапний план впровадження з окупністю на кожному етапі.

Як наша команда оцифровує архіви: сім кроків

  1. Підготовка й обстеження фонду. Оцінюємо стан носіїв, обсяг, типи документів, вимоги до конфіденційності. Далі визначаємо регламент обробки й вибір техніки під конкретний масив.
  2. Роботизоване сканування. Безконтактне для крихких справ, потокове — для однорідних розшитих масивів. Кожна коробка й справа мають штрих-код. Кількість аркушів звіряється автоматично.
  3. OCR і аналіз. Розпізнавання тексту з донавчанням моделі під мову, шрифт і почерк конкретного фонду.
  4. Контроль якості. Вибіркова перевірка людиною плюс автоматичні прапорці низької впевненості. Фіксуємо відсоток точності по кожній партії, а не по проєкту загалом.
  5. Семантичне тегування. Витяг сутностей і побудова метаданих: хто, що, коли, у якій справі, з яким документом пов’язано.
  6. Захищене архівування. Розмежування прав доступу, журнал дій, резервні копії, відповідність вимогам щодо зберігання службової інформації.
  7. Векторизація та підключення до LLM. Документи розбиваються на фрагменти, індексуються у векторній базі й підключаються до RAG-асистента, який відповідає на запит текстом із посиланням на конкретний аркуш конкретної справи.

Кроки 1–4 роблять багато підрядників. Кроки 5–7 — це те, заради чого взагалі варто починати проєкт, і саме тут потрібна розробка систем на основі ШІ, а не послуга сканування.

Кейс: як геологічний архів став ШІ-асистентом (GeoAI)

Вихідна інформація: десятиліття геологічних звітів, карт і технічної документації на папері та в розрізнених файлах. Щоб відповісти на запит про конкретну ділянку, фахівцеві доводилося вручну переглядати справи – це дні роботи, і результат залежав від того, хто саме шукав.

Що зробила наша команда у платформі GeoAI:

  • звели розрізнені архіви в єдине структуроване сховище;
  • розпізнали текст і витягли ключові сутності: назви ділянок, координати, показники, дати досліджень;
  • векторизували корпус і підключили його до мовної моделі за архітектурою RAG;
  • побудували інтерфейс, у якому дослідник ставить запитання звичайною мовою.

Результат: замість днів перегляду справ – перевірена відповідь за секунди з посиланням на першоджерело. Принципова відмінність від звичайного чат-бота – відповідь будується на документах із конкретного архіву та супроводжується посиланням на першоджерело. Це суттєво знижує ризик галюцинацій і дає змогу користувачу перевірити відповідь.

Скільки це коштує і від чого залежить бюджет

Розберемо, що впливає на ціну. Кошторис формують шість факторів:

Фактор Що збільшує вартість
Стан носія Крихкий папір, пліснява, реставрація перед скануванням
Формат Карти, креслення, нестандартні розміри, оправи, що не розкриваються
Необхідність розшивання Заборона розшивати: лише безконтактне сканування, у 3–5 разів повільніше
Тип тексту Друкований набагато дешевший за рукописний скоропис
Глибина метаданих «Просто текст» дешевше за витяг 15 полів по кожному документу
Вимоги до безпеки Робота на території замовника, ДСК, обмежений доступ

Як ми рахуємо такі проєкти, описано в калькуляції вартості розробки ПЗ. І варто знати: якщо архів не зв’язаний з ERP або СЕД, ним не користуватимуться. Про вибір облікової системи можна подивитись в нашому рев’ю про те, як обрати ERP-систему в Україні.

Часті запитання

Чим оцифрування відрізняється від сканування?

Сканування створює зображення сторінки: PDF або JPEG. Оцифрування створює дані: машиночитаний текст, метадані, класифікацію документів і зв’язки між справами. У скані можна тільки дивитися; в оцифрованому архіві можна шукати, фільтрувати й підключати документи до ШІ-асистента.

Чи можна оцифрувати документи без розшивання?
Так. Роботизовані книжкові сканери працюють із V-подібною колискою: у ScanRobot 2.0 MDS кут розкриття регулюється в діапазоні 60–100°. Це стандартне рішення для архівних справ, книг і документів, які не можна або небажано розшивати через їхній стан, цінність чи вимоги до зберігання.
Наскільки точно OCR розпізнає українські рукописні документи?
Орієнтир Transkribus: CER менше 1% досяжний для простого друкованого тексту, а 5% або менше вважається дуже добрим результатом для складного рукопису. Щоб дійти до цього рівня на конкретному фонді, потрібно щонайменше 10 000 слів навчального матеріалу для кожного окремого почерку.
Що таке RAG і навіщо він в архіві?
RAG (retrieval-augmented generation) – це архітектура, за якої мовна модель перед відповіддю знаходить релевантні фрагменти у вашому архіві й будує відповідь на них. Практична різниця: асистент цитує реальний документ і показує посилання на аркуш, замість того, щоб вигадувати правдоподібний текст.
Хто в Україні зобов’язаний оцифровувати документи?
Прямого універсального обов’язку для бізнесу немає. Державні архівні установи працюють за Програмою зацифрування архівних інформаційних ресурсів на 2026–2030 роки. Для органів влади діє експериментальний проєкт електронного документообігу службової інформації на 2026–2028 роки. Комерційні компанії оцифровують добровільно – зазвичай через строки зберігання та швидкість пошуку.
Всього переглядів
94 перегляди

1

Подібні статті

Читайте ще

Найновіші новини галузі, інтерв'ю, технології та ресурси.

Усі статті