“Pymupdf wyodrębnia cały tekst z PDF” Kod odpowiedzi

Pymupdf wyodrębnia cały tekst z PDF

import sys, fitz
fname = sys.argv[1]  # get document filename
doc = fitz.open(fname)  # open document
out = open(fname + ".txt", "wb")  # open text output
for page in doc:  # iterate the document pages
    text = page.get_text().encode("utf8")  # get plain text (is in UTF-8)
    out.write(text)  # write text of page
    out.write(bytes((12,)))  # write page delimiter (form feed 0x0C)
out.close()

XeN0N

Odpowiedzi podobne do “Pymupdf wyodrębnia cały tekst z PDF”

Pytania podobne do “Pymupdf wyodrębnia cały tekst z PDF”

Więcej pokrewnych odpowiedzi na “Pymupdf wyodrębnia cały tekst z PDF” w Python

Przeglądaj popularne odpowiedzi na kod według języka

Przeglądaj inne języki kodu

Shell/Bash

C++

CSS

HTML

Java

JavaScript

Objective-C

PHP

Python

Sql

Swift

Ruby

TypeScript

Kotlin

Assembly

VBA

Scala

Rust

Dart

Elixir

Clojure

Haskell

Matlab

Erlang

Cobol

Fortran

Scheme

Perl

Groovy

Lua

Julia

Delphi

Abap

Lisp

Prolog

Pascal

ActionScript

Basic

Solidity

PowerShell

GDScript

Excel