Удаление данных из PDF
Настоящее удаление — текст удалён и проверен.
Нет файла под рукой?
Отмеченные страницы пересобираются как плоские изображения — скрытый текст удаляется из файла, а не маскируется. Перед появлением скачивания инструмент повторно открывает результат и подтверждает, что на каждой отредактированной странице осталось ноль текста. Метаданные документа (заголовок, автор…) также очищаются.
Проведите по странице, чтобы закрыть рамкой конфиденциальные данные. Рамки привязаны только к этой странице.
Редактирование, которое действительно удаляет текст
Чёрный прямоугольник поверх текста в обычном PDF-редакторе ничего не скрывает: слова остаются в файле и извлекаются копированием или поисковым индексом. Этот инструмент пересобирает каждую отмеченную страницу как плоское изображение, поэтому скрытых текстовых объектов больше нет, затем повторно открывает результат и извлекает текст с каждой отредактированной страницы, подтверждая нулевое количество до скачивания.
Неотмеченные страницы копируются без изменений, и всё выполняется в браузере: редактируемый документ — именно тот файл, который не следует никуда загружать.
Большинство способов «редактирования» фиктивны: чёрный прямоугольник поверх текста скрывает пиксели, но не данные. Выделите закрытую область, скопируйте и вставьте — секрет снова виден. Именно так происходили утечки из судебных документов и государственных публикаций. Настоящее удаление должно убирать текст из самого файла. Этот инструмент заново отрисовывает каждую отмеченную страницу как плоское изображение, поэтому закрытых слов в результате больше не существует.
Затем инструмент это доказывает. После создания отредактированного PDF он повторно открывает результат и извлекает текст с каждой отредактированной страницы — кнопка скачивания появляется только при точном результате в ноль символов. Одновременно очищаются метаданные документа (заголовок, автор, тема, ключевые слова, создатель), поскольку свойства файла тоже раскрывают имена и организации.
Документ, требующий удаления конфиденциальных данных, почти по определению нельзя загружать на случайный сайт. Всё здесь — отрисовка, закрашивание, пересборка и самопроверка — выполняется локально в браузере. Неотмеченные страницы копируются без изменений, и их текст остаётся выделяемым.
Вопросы и ответы
Почему страницы растрируются, а не просто закрываются чёрными прямоугольниками?
Потому что чёрный прямоугольник поверх текста — лишь косметика: текстовые объекты остаются в файле и могут быть восстановлены копированием, извлечением текста или поисковым индексом. Пересборка отмеченной страницы в плоское изображение полностью удаляет текстовый слой — извлекать больше нечего. Поэтому текст на отредактированных страницах также нельзя выделить.
Что именно проверяет самопроверка?
После создания результата инструмент снова открывает его и извлекает текст с каждой отредактированной страницы. Кнопка скачивания появляется только если получено ноль текстовых символов и число страниц совпадает с оригиналом. Если удаётся что-либо извлечь, файл не предлагается.
Изменяются ли неотмеченные страницы?
Нет. Страницы без рамок копируются с исходным содержимым: текст остаётся выделяемым, ссылки работают. Как изображения пересобираются только отмеченные страницы.
Что происходит с метаданными PDF?
В результате очищаются заголовок, автор, тема, ключевые слова, создатель и производитель — свойства документа часто раскрывают имена, работодателей и версии программ. Имя файла по-прежнему выбираете вы.
Загружается ли мой документ?
Нет. Отрисовка, удаление данных, пересборка и самопроверка выполняются в браузере. Документ с конфиденциальными данными — именно тот файл, который не должен попадать на сторонний сервер.
Работает ли это с отсканированными PDF?
Да. Отсканированные страницы уже являются изображениями, поэтому рамка поверх конфиденциальной области и пересборка работают так же. Инструмент удаляет видимое содержимое и не выполняет OCR.
Почему файл стал больше или меньше?
Отредактированные страницы перекодируются в JPEG с выбранным разрешением (96/144/216 dpi). Страницы с большим количеством текста обычно немного увеличиваются, а страницы с изображениями часто уменьшаются. Неотмеченные страницы не меняются.