PDF

Вилучення даних із PDF

Справжнє вилучення — текст видалено й перевірено.

Немає файлу під рукою?

Позначені сторінки перебудовуються як пласкі зображення — прихований текст видаляється з файла, а не маскується. Перед появою завантаження інструмент знову відкриває результат і підтверджує, що на кожній відредагованій сторінці залишилося нуль тексту. Метадані документа (назва, автор…) також очищуються.

Редагування, яке справді видаляє текст

Чорний прямокутник поверх тексту у звичайному PDF-редакторі нічого не приховує: слова залишаються у файлі й видобуваються копіюванням або пошуковим індексом. Цей інструмент перебудовує кожну позначену сторінку як пласке зображення, тому прихованих текстових об'єктів більше немає, а потім знову відкриває результат і видобуває текст із кожної відредагованої сторінки, підтверджуючи нульову кількість до завантаження.

Непозначені сторінки копіюються без змін, і все виконується у браузері: документ, який ви редагуєте, — саме той файл, який не слід нікуди завантажувати.

Більшість способів «редагування» несправжні: чорний прямокутник поверх тексту приховує пікселі, а не дані. Виділіть закриту ділянку, скопіюйте й вставте — секрет знову видно. Саме так траплялися витоки із судових документів і державних публікацій. Справжнє видалення має прибирати текст із самого файла. Цей інструмент заново відтворює кожну позначену сторінку як пласке зображення, тому закритих слів у результаті більше не існує.

Потім інструмент це доводить. Після створення відредагованого PDF він знову відкриває результат і видобуває текст із кожної відредагованої сторінки — кнопка завантаження з'являється лише за точного результату в нуль символів. Одночасно очищуються метадані документа (назва, автор, тема, ключові слова, творець), оскільки властивості файла також розкривають імена й організації.

Документ, що потребує видалення конфіденційних даних, майже за визначенням не слід завантажувати на випадковий сайт. Усе тут — відтворення, зафарбовування, перебудова та самоперевірка — виконується локально у браузері. Непозначені сторінки копіюються без змін, а їхній текст залишається доступним для виділення.

Поширені запитання

Чому сторінки растеризуються, а не просто закриваються чорними прямокутниками?

Бо чорний прямокутник поверх тексту — лише косметика: текстові об'єкти залишаються у файлі й можуть бути відновлені копіюванням, видобуванням тексту або пошуковим індексом. Перебудова позначеної сторінки як плаского зображення повністю видаляє текстовий шар — видобувати більше нічого. Тому текст на відредагованих сторінках також не можна виділити.

Що саме перевіряє самоперевірка?

Після створення результату інструмент знову відкриває його та видобуває текст із кожної відредагованої сторінки. Кнопка завантаження з'являється лише якщо отримано нуль текстових символів і кількість сторінок збігається з оригіналом. Якщо щось можна видобути, файл не пропонується.

Чи змінюються непозначені сторінки?

Ні. Сторінки без рамок копіюються з початковим вмістом: текст залишається доступним для виділення, посилання працюють. Як зображення перебудовуються лише позначені сторінки.

Що відбувається з метаданими PDF?

У результаті очищуються назва, автор, тема, ключові слова, творець і виробник — властивості документа часто розкривають імена, роботодавців і версії програм. Ім'я файла й надалі вибираєте ви.

Чи завантажується мій документ?

Ні. Відтворення, видалення даних, перебудова та самоперевірка виконуються у браузері. Документ із конфіденційними даними — саме той файл, який не має потрапляти на сторонній сервер.

Чи працює це з відсканованими PDF?

Так. Відскановані сторінки вже є зображеннями, тому рамка поверх конфіденційної ділянки та перебудова працюють так само. Інструмент видаляє видимий вміст і не виконує OCR.

Чому файл став більшим або меншим?

Відредаговані сторінки перекодовуються у JPEG із вибраною роздільністю (96/144/216 dpi). Сторінки з великою кількістю тексту зазвичай трохи збільшуються, а сторінки із зображеннями часто зменшуються. Непозначені сторінки не змінюються.