PDF Bersih
Pembersihan PDF langsung di perangkat. Berkas tidak diunggah ke server pemrosesan.
Pilih PDF
Tarik banyak PDF ke area ini
atau pilih berkas maupun satu folder
Batas proteksi saat ini 500 PDF per proses, 250 MB per PDF, dan 300 halaman per PDF yang memerlukan pembersihan mendalam. Kapasitas nyata tetap bergantung pada RAM, panjang dokumen, dan browser. PDF diproses satu per satu.
Belum ada PDF dipilih.
Mode cegah tidur siap.
Daftar PDF
0 PDF| No. | Nama berkas | Ukuran | Status | Temuan awal |
|---|---|---|---|---|
| Belum ada PDF. | ||||
- Setelah sanitasi, aplikasi memeriksa searchability per halaman tanpa OCR terlebih dahulu.
- Halaman yang sudah memiliki text layer yang memadai dipertahankan apa adanya; OCR hanya dijalankan pada halaman yang membutuhkan.
- OCR utama memakai Tesseract.js pada raster 150 dpi dengan maksimal dua worker. Ini dipilih karena benchmark pada dokumen nyata menunjukkan throughput lebih tinggi di laptop pengguna.
- PaddleOCR PP-OCRv5 Latin tidak lagi membaca semua halaman. Ia dipanggil selektif untuk mengaudit halaman yang confidence, jumlah teks, atau kebersihan hasil Tesseract-nya lemah. Paddle hanya menggantikan hasil Tesseract bila peningkatannya cukup jelas.
- Render halaman dipakai bersama: halaman dirender sekali, lalu bitmap yang sama dapat diberikan ke Tesseract dan Paddle rescue sebelum dilepas dari RAM.
- Jumlah audit Paddle dibatasi secara konservatif hingga maksimal 30% halaman OCR dan paling banyak 8 halaman per PDF agar quality rescue tidak mengorbankan throughput bulk.
- PDF pengguna tidak dikirim ke layanan OCR. Paddle rescue mengambil SDK/runtime/model melalui origin Cloudflare yang sama; Cloudflare meng-cache aset upstream, sedangkan inferensi tetap dilakukan lokal di browser.
- Screen Wake Lock diminta selama pemrosesan untuk membantu mencegah sleep otomatis. Sleep manual, menutup lid, atau pembekuan tab oleh browser tetap dapat menghentikan atau memperlambat komputasi.
- Pipeline tidak menggunakan requestAnimationFrame untuk OCR; saat tab kembali aktif aplikasi mencoba memperoleh wake lock lagi.
- Laporan hasil membedakan text layer literal dengan searchable memadai, sehingga halaman yang hanya berisi sedikit teks tidak lagi terlihat seolah OCR gagal.
- Laporan juga mencatat halaman Paddle yang diaudit dan berapa hasil Paddle yang benar-benar dipakai, selain waktu Tesseract/Paddle.
- Jika OCR pada satu PDF gagal, PDF pasif yang sudah bersih tetap dimasukkan ke ZIP dan diberi keterangan pada laporan.
- Tanda tangan digital, formulir, lampiran, anotasi, metadata, tautan aktif, dan fitur interaktif dapat hilang.
- Simpan PDF asli secara terpisah. Aplikasi ini bukan pengganti antivirus.