Идеальная реконструкция макета: как нейронная линза решает перевод PDF-файлов
Идеальная реконструкция макета: как нейронная линза решает перевод PDF-файлов
Для исследователей, инженеров и юристов чтение PDF-файлов на иностранных языках является повседневной необходимостью. Однако традиционные инструменты перевода часто портят впечатление: переведенный текст накладывается, ломается многоколоночная разметка, таблицы исчезают, а математические формулы превращаются в нечитаемые символы.
Это связано с тем, что основной задачей перевода PDF является не сам перевод, а сохранение сложной пространственной структуры документа.
Вот как Neural Lens решает эти проблемы с помощью движка BabelDOC.
Основные технические барьеры PDF-файлов
PDF (Portable Document Format) — это, по сути, «электронный документ». Его кодовая база содержит только абсолютные физические координаты для рисования символов, линий и изображений. Ему не хватает какого-либо высокого уровня понимания «абзацев», «столбцов», «таблиц» или «порядка чтения». Это приводит к трем основным проблемам:
- Фрагментация текста. В инструкциях по рендерингу PDF-файла непрерывное предложение часто разбивается на отдельные фрагменты слов. Наивные экстракторы извлекают эти фрагменты не по порядку, что приводит к бессмысленным переводам.
- Уничтожение формул: математические уравнения (LaTeX) и рисунки ошибочно идентифицируются как обычный текст, в результате чего механизмы перевода принудительно переводят их.
- Наложение текста (расширение). При переводе между языками (например, с английского на китайский) объем текста может увеличиваться или уменьшаться на 30–50 %. Статические замены приводят к выходу текста за соседние изображения или границы абзаца.
BabelDOC: четыре шага к идеальному сохранению макета
Механизм BabelDOC, интегрированный в Neural Lens, использует визуальный анализ с учетом макета и потоковую реконструкцию документов:
Document pipeline
PDF layout preservedOriginal PDF File
Visual Layout Analysis
Logical Paragraph Merging
Mathematical Formula Protection
Dynamic Flow Reflow
Generate Translated PDF / Dual-Language PDF
1. Визуальный анализ макета
BabelDOC начинается с запуска алгоритма определения макета, который сканирует PDF-файл для поиска столбцов, верхних и нижних колонтитулов, изображений и таблиц. Это гарантирует, что тексты, состоящие из нескольких столбцов, будут читаться и переводиться в правильной логической последовательности.
2. Логическое объединение абзацев
Движок реконструирует разорванные фрагменты текста обратно в связные предложения на основе пространственного расстояния и лингвистических маркеров. Восстановленный текст затем отправляется в расширенные LLM (например, GPT-4o или Claude 3.5), обеспечивая контекстуально точный перевод.
3. Защита по формуле Safe-Tag
Перед переводом BabelDOC автоматически заменяет формулы, блоки кода и диаграммы безопасными тегами-заполнителями (например, [__MATH_FORMULA_3__]). Механизм перевода сохраняет эти теги, которые позже восстанавливаются в исходные форматы LaTeX с помощью BabelDOC.
4. Динамическая перекомпоновка потока
Чтобы справиться с расширением языка, BabelDOC динамически перекомпоновывает документ. Он на лету микронастраивает размеры шрифтов, высоту строк и границы элементов, устраняя перекрытие и перекосы текста.
Портал против настольного клиента
Neural Lens предоставляет как веб-портал, так и собственные настольные приложения:
Если вы регулярно читаете статьи и технические спецификации, загрузите приложение Neural Lens, чтобы упростить свой рабочий процесс!