<menu id="ycqsw"></menu><nav id="ycqsw"><code id="ycqsw"></code></nav>

<dd id="ycqsw"><menu id="ycqsw"></menu></dd>

<nav id="ycqsw"></nav>

<menu id="ycqsw"><strong id="ycqsw"></strong></menu>

<xmp id="ycqsw"><nav id="ycqsw"></nav>

python提取數據指定列（用python處理excel數據）

長城號SEO專員 ? 2021年9月8日 08:54:25 ? 投稿

本文分享一個基于 PDF 的 Python 辦公自動化的案例解決，也是某位財務小姐姐提出的真實需求，先來看看需求。

需求描述

在某個文件夾下有多個 PDF 類型發票

解放雙手｜Python 批量自動提取、整理 PDF 發票

每一張發票 PDF 是純圖片類型，里面的文字信息無法手動復制（事實上大多數發票可以復制部分文字，但我們扔以圖片形式來講解），大致如下圖所示：

解放雙手｜Python 批量自動提取、整理 PDF 發票

需要滿足的需求是：獲取 總金額、納稅人識別號、開票人，即如下三個方框位置：

解放雙手｜Python 批量自動提取、整理 PDF 發票

最后結合批量操作，在獲取上述信息后將其存儲入 Excel 中！

解放雙手｜Python 批量自動提取、整理 PDF 發票

思路與代碼實現

需求本質是一個圖片識別問題，因為 PDF 里的內容是圖片類型，無法按常規方法直接把文本抽提出來。解決思路是利用光學字符識別（OCR）將圖片中的文字識別出。但同時也需要注意，PDF 畢竟不是圖片，為了完成 OCR，除了OCR自身之外還要下載 Ghostscript 和 ImageMagick 用來完成類型轉換。已 Windows 系統為例，需要在電腦上安裝以下三個軟件：

Ghostscript 32 位
ImageMagick 32 位
tesseract-OCR 32 位

三個軟件的下載安裝沒有特殊的地方（tesseract 配置稍復雜但網絡有上諸多教程，這里不再贅述），讀者可自行搜索下載及配置，下面講解代碼。首先導入需要的模塊：

from wand.image import Image
from PIL import Image as PI
import pyocr
import pyocr.builders
import io
import re
import os
import shutil

具體的模塊用途可以參考下面具體代碼。其中 wand 和 pyocr 由于是非標準庫需要自行額外安裝。打開命令行輸入：

pip install wand
pip install pyocr

本需求還涉及對接 Excel，可考慮利用 openpyxl 庫的 Workbook 用以創建新的 Excel 文件：

from openpyxl import Workbook

需求中的發票.pdf 放在桌面上?？赏ㄟ^下面基于 os 模塊的代碼獲取桌面路徑：

# 獲取桌面路徑包裝成一個函數
def GetDesktopPath():
    return os.path.join(os.path.expanduser("~"), 'Desktop')

path = GetDesktopPath() + r'發票.pdf'

獲取配置好的 tesseract 便于后面調用：

tool = pyocr.get_available_tools()[0]

通過 wand 模塊將 PDF 文件轉化為分辨率為 300 的 jpeg 圖片形式：

image_pdf = Image(filename=path, resolution=300)
image_jpeg = image_pdf.convert('jpeg')

將圖片解析為二進制矩陣：

image_lst = []
for img in image_jpeg.sequence:
    img_page = Image(image=img)
    image_lst.append(img_page.make_blob('jpeg'))

用 io 模塊的 BytesIO 方法讀取二進制內容為圖片形式：

new_img = PI.open(io.BytesIO(image_lst[0]))
new_img.show()

接下來分別截取需要提取部位字符串的圖片了，盡量讓圖片中只有需要識別的部分，獲取識別出來容易簡單處理獲得需要的內容。

首先以總金額為例，截取圖片用 image.crop((left, top, right, bottom)) 四個參數需要反復調試才能確定。經確定四個參數分別是 1600 760 1830 900，嘗試截取和預覽圖片：

### 解析1Z開頭碼
left = 350
top = 600
right = 1300
bottom = 730
image_obj1 = new_img.crop((left, top, right, bottom))
image_obj1.show()

解放雙手｜Python 批量自動提取、整理 PDF 發票

截取成功后可以交給 OCR 了，代碼為 tool.image_to_string()

txt1= tool.image_to_string(image_obj1)
print(txt1)

解放雙手｜Python 批量自動提取、整理 PDF 發票

同樣，通過方位的調試就可以準確切割到需要的部分進行識別：

left = 560
top = 1260
right = 900
bottom = 1320
image_obj2 = new_img.crop((left, top, right, bottom))
# image_obj2.show()
txt2 = tool.image_to_string(image_obj2)
# print(txt2)

最后是開票人的識別

解放雙手｜Python 批量自動提取、整理 PDF 發票

left = 1420
top = 1420
right = 1700
bottom = 1500
image_obj3 = new_img.crop((left, top, right, bottom))
# image_obj3.show()
txt3 = tool.image_to_string(image_obj3)
# print(txt3)

解放雙手｜Python 批量自動提取、整理 PDF 發票

需要確認識別的內容是否正確，如果識別正確率欠佳可以考慮通過圖片處理技術消除噪聲，也可以去官網下載更高精度的訓練包提高識別的正確性

至此，我們成功的識別了總金額、納稅人識別號、開票人三個消息，接下來就通過非常熟悉的 openpyxl 寫入Excel，并使用 os 模塊實現批量操作即可

workbook = Workbook()
sheet = workbook.active
header = ['總金額', '納稅人識別號', '開票人']
sheet.append(header)
sheet.append([txt1, txt2, txt3])
workbook.save(GetDesktopPath() + r'匯總.xlsx')

解放雙手｜Python 批量自動提取、整理 PDF 發票

綜上，整個需求就成功實現，從效果來看還是非常不錯的！完整源碼可由文中代碼組合而成（已全部分享在文中），感興趣的讀者可以自己嘗試！

最后想說的是，其實本文的案例可以衍生出很多實用的辦公自動化腳本，例如

批量計算發票金額并重命名文件夾
根據發票類型批量分類
根據發票批量制作報銷單
··· ···

點擊展開全文

贊 (0)

長城號SEO專員管理員

excel表格制作教程（入門wps表格制作全步驟）

Excel表格為最常用辦公表格嗎，其制作在如今工作生活中是最常用到的，重要性可以說和會識字寫字一樣。如果你一點不會excel制作，沒關系，今天我們就以制作一個”成績單”為實例進行學…
長城號SEO專員
2019年10月18日 ? 投稿
如何恢復excel，excel表格數據恢復教程

Excel文件不小心誤刪了？沒關系，接下來就給大家介紹幾個非常好用的方法，幫助大家可以快速恢復文件。一、電腦端 1.WPS恢復功能第一個是WPS自帶的恢復功能，只要我們點擊左上…
劉英
2020年1月2日 ? 投稿
鏈接怎么做，Excel制作超鏈接教程

Excel怎么做超鏈接？真是太簡單了！現在excel表格的強大之處已經不言而喻，做超鏈接也成為家常便飯。Excel怎么做超鏈接，這個問題的解決方法有很多，但是簡單快速且美觀的的方法…
劉英
2020年1月6日 ? 投稿
excel不小心保存了怎么恢復，excel恢復以往數據教程

相信大家都有過誤刪文件的經歷，特別是誤刪了office文檔找不著，相當于要把工作重新做一遍，實在是太慘了，所以今天就教大家幾個非常好用的恢復方法。一、電腦端 1.WPS備份中心 …
劉英
2020年1月6日 ? 投稿
excel怎么恢復誤刪數據，excel恢復已往數據流程

Excel等文件難免會被誤刪掉，特別是有時候電腦壞了，一黑屏，什么東西都沒有了，所以你一定要學會以下幾種恢復方法。一、手機端 1.華為恢復第一種是用我們的華為手機，只要你選擇【…
劉英
2020年1月7日 ? 投稿
excel怎么保存，excel快速保存技巧

excel是最基礎的辦公技能，我們需要熟練掌握，不過也會遇到一些問題，比如怎么恢復未保存的excel文件？下面就為大家講解一下。 1 打開excel 2 點擊”文件“ 3 點擊”信…
劉英
2020年1月8日 ? 投稿

版權聲明：本文內容由互聯網用戶自發貢獻，該文觀點僅代表作者本人。本站僅提供信息存儲空間服務，不擁有所有權，不承擔相關法律責任。如發現本站有涉嫌抄襲侵權/違法違規的內容，請發送郵件至舉報，一經查實，本站將立刻刪除。

發表評論

登錄后才能評論

国产精品区一区二区免费