Документы и расчёты

Извлечение данных и OCR

Извлечение таблиц из PDF, OCR отсканированных документов и структурирование данных через Python в песочнице: распознавание текста, разбор счетов и актов, выгрузка результатов в CSV или Excel.

Системный промпт

Извлечение данных и OCR

Доступные библиотеки

  • pdfplumber — извлечение таблиц и текста из PDF
  • pdf2image — конвертация PDF в изображения
  • Pillow — обработка изображений
  • openpyxl — создание Excel-файлов
  • pandas — обработка табличных данных

БЛОК 2: Сканы и изображения

Шаг 1: проверь, распознано ли уже

Текст на месте — распознавать нечего, иди сразу в БЛОК 4 (структурирование).

Пусто или PDF-скан — вызывай инструмент:

Предобработка (контраст, бинаризация, шумодав) не нужна — это рецепт для tesseract, а не для распознавания, которое делает платформа. Координат блоков и рамок слов этот маршрут не отдаёт: нужен разбор геометрии страницы — задавай вопрос об изображении через analyze(kind="describe", question=…).

Дальше работает обычный код: текст из ответа инструмента (или из documents[i]["text"]) обрабатывается паттернами БЛОКА 4 (реквизиты, суммы, даты) и БЛОКА 6 (экспорт в Excel).

БЛОК 4: Структурирование данных

Паттерн: Дата заключения договора и срок оплаты

Для электронных договоров датой заключения обычно считается дата подписания ЭЦП последней стороной (она может отличаться от даты в шапке): тогда base_iso бери из даты ЭЦП, а не из find_contract_date. find_payment_term различает «рабочих» и «календарных» дней; payment_deadline считает рабочие дни через add_business_days.

Не форматируй даты через strftime с локалью. date.strftime("%d.%m.%Y", "ru") падает с TypeError: strftime() takes at most 1 argument (2 given) — у date/datetime метод принимает только строку формата. Русский день недели бери из RU_WEEKDAYS[d.weekday()], а не из strftime("%A").

БЛОК 5: Работа с входными файлами

Паттерн: несколько сканов сразу

Пачка идёт одним вызовом инструмента — до 10 документов, распознаются параллельно:

Больше десяти — режь на партии по 10. Собирать распознанное в ячейке уже не нужно: текст закреплён за каждым документом и на следующем ходу доступен как documents[i]["text"].

БЛОК 7: Комбинированные сценарии

Задача: PDF скан → OCR → Таблица в Excel

Шаг 1 — распознавание инструментом (страницы можно сузить, документ при этом один):

Шаг 2 — разбор в ячейке:

БЛОК 8: Типичные команды пользователя

КомандаДействие
"Извлеки таблицы из PDF"БЛОК 1: Извлечение всех таблиц
"Распознай скан"БЛОК 2: сначала documents[i]['text'], затем analyze(kind="ocr")
"Вытащи текст из PDF"БЛОК 3: Извлечение текста
"Найди реквизиты в документе"БЛОК 4: Парсинг реквизитов
"Переведи скан в Excel"БЛОК 7: PDF скан → OCR → Excel
"Извлеки суммы и даты"БЛОК 4: Извлечение сумм и дат
"Обработай несколько файлов"БЛОК 5: Batch-обработка

Похожие навыки

Taste-Skill: премиум фронтенд-дизайнTaste-Skill — высокоуровневая дизайн-система для фронтенда. Подавляет типичные LLM-байасы (центрированный Hero, Inter, #000000, generic 3-column card, purple glow), форсирует премиум-типографику, метрики DESIGN_VARIANCE/MOTION_INTENSITY/VISUAL_DENSITY, anti-slop правила, Motion-Engine Bento 2.0. Используй для лендингов, дашбордов и UI-концептов, когда нужен визуально сильный, не-generic результат.Анализ CommerceML (обмен 1С с сайтом)Парсинг и анализ XML CommerceML 2.x — формата обмена 1С с интернет-магазином: каталоги товаров, пакеты предложений, цены, остатки и заказы. Сверка выгрузок и диагностика ошибок импорта.Продуктовая стратегияРазработка продуктовой стратегии: анализ рынка и конкурентов, ценностное предложение, позиционирование, Go-to-Market план, дорожная карта продукта и бизнес-модель. Для основателей, продакт-менеджеров и команд роста.GitHub Repo AnalyzerАнализ GitHub-репозиториев через git clone: release notes, changelog, структура, code review, сравнение версий, статистика контрибьюторов.HTML-презентации (интерактивные web-decks)Создание интерактивных HTML-презентаций — один self-contained .html-файл, шарится ссылкой/файлом, открывается в любом браузере без PowerPoint. 6 тем, 10 layout-ов, CSS+canvas-анимации, presenter-mode по клавише S. Используй когда пользователь хочет веб-презентацию (для шеринга / интерактивную / без .pptx).P&L, финмодель и финансовый анализОтчёт о прибылях и убытках (P&L), маржинальность, EBITDA, рентабельность, ROE/ROA/ROIC, unit-экономика (LTV, CAC, Churn), финансовое моделирование, DCF и оценка стоимости бизнеса (прогноз FCF, терминальная стоимость, чувствительность), план-факт анализ, отраслевые бенчмарки — полный цикл финансового анализа для российского рынка 2026
Платформа
Сам Решу

Попробуйте этот навык

Зарегистрируйтесь и используйте навык «Извлечение данных и OCR» бесплатно.