导语:
本文主要介绍了关于pdf如何用python读取?的相关知识,包括崔庆才python3爬虫pdf,以及python爬虫pdf这些编程知识,希望对大家有参考作用。
python中可以使用pdfminer库来读取PDF文件中的内容。
安装命令:
pip install pdfminer
pip install pdfminer3k
python中读取PDF文件代码:
from urllib.request import urlopen
from pdfminer.pdfinterp import PDFResourceManager, process_pdf
from pdfminer.converter import TextConverter
from pdfminer.layout import LAParams
from io import StringIO
from io import open
def readPDF(pdfFile):
rsrcmgr = PDFResourceManager()
retstr = StringIO()
laparams = LAParams()
device = TextConverter(rsrcmgr, retstr, laparams=laparams)
process_pdf(rsrcmgr, device, pdfFile)
device.close()
content = retstr.getvalue()
retstr.close()
return content
pdfFile = urlopen("http://pythonscraping.com/pages/warandpeace/chapter1.pdf")
outputString = readPDF(pdfFile)
print(outputString)
pdfFile.close()
解析pdf文件用到的类:
PDFParser:从一个文件中获取数据
PDFDocument:保存获取的数据,和PDFParser是相互关联的
PDFPageInterpreter处理页面内容
PDFDevice将其翻译成你需要的格式
PDFResourceManager用于存储共享资源,如字体或图像。
本文为原创文章,版权归知行编程网所有,欢迎分享本文,转载请保留出处!
你可能也喜欢
- ♥ python关键字如何传递参数10/06
- ♥ python不支持next方法吗?01/14
- ♥ Python 列表中的常用方法12/18
- ♥ 什么是python迭代器10/07
- ♥ python shutil 操作文件有哪些方法01/02
- ♥ 如何在python3中转换utf-8编码?12/07
内容反馈