导语:
本文主要介绍了关于pdf如何用python读取?的相关知识,包括崔庆才python3爬虫pdf,以及python爬虫pdf这些编程知识,希望对大家有参考作用。
python中可以使用pdfminer库来读取PDF文件中的内容。
安装命令:
pip install pdfminer
pip install pdfminer3k
python中读取PDF文件代码:
from urllib.request import urlopen
from pdfminer.pdfinterp import PDFResourceManager, process_pdf
from pdfminer.converter import TextConverter
from pdfminer.layout import LAParams
from io import StringIO
from io import open
def readPDF(pdfFile):
rsrcmgr = PDFResourceManager()
retstr = StringIO()
laparams = LAParams()
device = TextConverter(rsrcmgr, retstr, laparams=laparams)
process_pdf(rsrcmgr, device, pdfFile)
device.close()
content = retstr.getvalue()
retstr.close()
return content
pdfFile = urlopen("http://pythonscraping.com/pages/warandpeace/chapter1.pdf")
outputString = readPDF(pdfFile)
print(outputString)
pdfFile.close()
解析pdf文件用到的类:
PDFParser:从一个文件中获取数据
PDFDocument:保存获取的数据,和PDFParser是相互关联的
PDFPageInterpreter处理页面内容
PDFDevice将其翻译成你需要的格式
PDFResourceManager用于存储共享资源,如字体或图像。
本文为原创文章,版权归知行编程网所有,欢迎分享本文,转载请保留出处!
你可能也喜欢
- ♥ 为什么python没有高效运行?10/25
- ♥ python中的sigmoid函数是什么09/13
- ♥ 熟练使用 Python 字典处理索引统计10/31
- ♥ 如何在python中使用popitem09/21
- ♥ map如何简化python3代码?11/19
- ♥ python注释是什么意思01/07
内容反馈