资源简介

首先安装这个 pip install pdfminer3k

然后将 附件中 1-297.pdf文件 放到 D:/test 目录下

然后在 python 3.6 环境下 运行 ParserPdf.py文件,即可看到如下效果

资源截图

代码片段和文件信息

#!/usr/bin/env python
# encoding: utf-8

“““
@author: guoliang
@software: PyCharm
@file: prase_pdf.py
@time: 2018/1/25
“““
import sys
import importlib
importlib.reload(sys)

from pdfminer.pdfparser import PDFParserPDFDocument
from pdfminer.pdfinterp import PDFResourceManager PDFPageInterpreter
from pdfminer.converter import PDFPageAggregator
from pdfminer.layout import LTTextBoxHorizontalLAParams
from pdfminer.pdfinterp import PDFTextExtractionNotAllowed

‘‘‘
 解析pdf 文本,保存到txt文件中
‘‘‘
path = r‘D:\test\1-297.pdf‘

def parse():
    contentText = ““
    fp = open(path ‘rb‘) # 以二进制读模式打开
    #用文件对象来创建一个pdf文档分析器
    praser = PDFParser(fp)
    # 创建一个PDF文档
    doc = PDFDocument()
    # 连接分析器 与文档对象
    praser.set_document(doc)
    doc.set_parser(praser)

    # 提

 属性            大小     日期    时间   名称
----------- ---------  ---------- -----  ----
     目录           0  2018-03-23 11:28  pdf_parser\
     文件     8357064  2018-01-22 16:57  pdf_parser\1-297.pdf
     文件        4547  2018-03-23 11:27  pdf_parser\ParserPdf.py

评论

共有 条评论