Python - PDF de proceso

Python puede leer archivos PDF e imprimir el contenido después de extraer el texto. Para eso tenemos que instalar primero el módulo requerido que esPyPDF2. A continuación se muestra el comando para instalar el módulo. Debería tener pip ya instalado en su entorno de Python.

pip install pypdf2

Tras la instalación exitosa de este módulo, podemos leer archivos PDF utilizando los métodos disponibles en el módulo.

import PyPDF2
pdfName = 'path\Tutorialspoint.pdf'
read_pdf = PyPDF2.PdfFileReader(pdfName)
page = read_pdf.getPage(0)
page_content = page.extractText()
print page_content

Cuando ejecutamos el programa anterior, obtenemos el siguiente resultado:

Tutorials Point originated from the idea that there exists a class of readers who respond better 
to online content and prefer to learn new skills at their own pace from the comforts of their 
drawing rooms.
 
The journey commenced with a single tutorial on HTML in 2006 and elated by the response 
it generated, we worked our way to adding fresh tutorials to our repository which now 
proudly flaunts a wealth of tutorials and allied articles on topics ranging from programming
languages to web designing to academics and much more.

Leer varias páginas

Para leer un pdf con varias páginas e imprimir cada una de las páginas con un número de página, usamos el bucle a con la función getPageNumber (). En el siguiente ejemplo, tenemos el archivo PDF que tiene dos páginas. El contenido se imprime en dos encabezados de página separados.

import PyPDF2
pdfName = 'Path\Tutorialspoint2.pdf'
read_pdf = PyPDF2.PdfFileReader(pdfName)
for i in xrange(read_pdf.getNumPages()):
    page = read_pdf.getPage(i)
    print 'Page No - ' + str(1+read_pdf.getPageNumber(page))
    page_content = page.extractText()
    print page_content

Cuando ejecutamos el programa anterior, obtenemos el siguiente resultado:

Page No - 1
Tutorials Point originated from the idea that there exists a class of readers who respond better to 
online content and prefer to learn new skills at their own pace from the comforts of their drawing 
rooms. 
Page No - 2
 
The journey commenced with a single tutorial on HTML in 2006 and elated by the response it 
generated, we worked our way to adding fresh tutorials to our repository which now proudly flaunts 
a wealth of tutorials and allied articles on topics ranging from p
rogramming languages to web 
designing to academics and much more.