使用C# CefSharp Python采集某網(wǎng)站簡歷并且自動發(fā)送邀請短信的方法
前言
以往爬蟲沒怎么研究過,最近有個需求,要從某網(wǎng)站采集敏感信息,稍稍考慮了一下,決定利用C# Winform和Python一起來解決這個事件。
整個解決方案不復(fù)雜:C#編寫WinForm窗體,進行數(shù)據(jù)分析和采集, Python本來不想用的,一下子沒找到C#下Woff字體轉(zhuǎn)Xml的方案,而網(wǎng)上Python的則有很多,所以就加了一個Python項目,雖然就1個腳本。
一、幾個步驟:
首先要模擬登錄,登錄完了進入簡歷采集,然后模擬下載,下載完了以后就可以看到求職者的電話了。
這個電話號碼是使用動態(tài)生成的Base64字體,所以直接提取文字是無法成功的。
1、先將Base64轉(zhuǎn)成Woff字體,這個可以用C#完成(這其中的iso-8859-1編碼是個坑,一般用Default會出現(xiàn)驚喜):
SetMainStatus("正在生成WOFF..."); byte[] fontBytes = Convert.FromBase64String(CurFont); string fontStr = Encoding.GetEncoding("iso-8859-1").GetString(fontBytes).TrimEnd('\0'); StreamWriter sw2 = new StreamWriter(@"R58.woff", false, Encoding.GetEncoding("iso-8859-1")); sw2.Write(fontStr); sw2.Close();
2、再將已經(jīng)生成的Woff轉(zhuǎn)成XML(WoffDec.exe是我用Python打包的Exe,其實有點小題大做了,為了這一個轉(zhuǎn)化專門打了一個包,有時間還是整一個C#下面的好)
//調(diào)用python exe 生成xml文件 ProcessStartInfo info = new ProcessStartInfo { FileName = "WoffDec.exe", WindowStyle = ProcessWindowStyle.Hidden }; Process.Start(info).WaitForExit(2000);//在2秒內(nèi)等待返回
整個WoffDec.py的代碼就3行:
from fontTools.ttLib import TTFont font = TTFont('R12.woff') font.saveXML('R12.xml')
這個打包是有點意思的,先試了py2exe,不成功,換pyinstaller, 成了,連EXE一起有11M,也不是很大。
https://github.com/pyinstaller/pyinstaller 下載 或者 本地下載 ,或者在VS2017 Python環(huán)境下搜索PyInstaller直接安裝。
右鍵使用“打開此處的命令提示符”;輸入pyinstaller /path/to/yourscript.py
即可打包成一個exe文件。在Winform應(yīng)用調(diào)用時,應(yīng)該整個文件夾都拷貝過去。
3、XML文件有了以后,以上面的Woff文件為基準準備為一個數(shù)據(jù)字典存儲起來(這個地方有點繞,先找一個網(wǎng)站把Woff顯示成文字和編碼,然后根據(jù)編碼在XML中查找它的字體定位點,我取的X和Y組成唯一值(X,Y就代表一個字),當然也可以取更多;
internal static readonly Dictionary<string, string> DicChar = new Dictionary<string, string>() { {"91,744","0" }, {"570,0","1"}, {"853,1143","2" }, {"143,259","3" }, 。。。。。。 };
4、上面這一步是要花點時間的,基準字典有了以后,就可以按每次生成的XML文件來進行匹配真實文字了。
5、真實文字取出后面的就簡單了,直接采集到數(shù)據(jù)庫,再連上短信發(fā)送業(yè)務(wù),就可以自動群發(fā)了。
二、使用場景
上班后開啟采集服務(wù)即不用再理會,由系統(tǒng)每間隔一段時間自動下載簡歷,并自動推送面試邀請短信。只要有新人發(fā)布對口的求職信息,系統(tǒng)就會馬上給他發(fā)送邀請,實為搶人利器。
BTW:網(wǎng)頁模擬操作使用的CEFSharp將另開一章。
總結(jié)
以上就是這篇文章的全部內(nèi)容了,希望本文的內(nèi)容對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,謝謝大家對我們的支持。
欄 目:C#教程
下一篇:Unity實現(xiàn)粒子光效導(dǎo)出成png序列幀
本文標題:使用C# CefSharp Python采集某網(wǎng)站簡歷并且自動發(fā)送邀請短信的方法
本文地址:http://mengdiqiu.com.cn/a1/C_jiaocheng/4826.html
您可能感興趣的文章
- 01-10C#使用Dispose模式實現(xiàn)手動對資源的釋放
- 01-10C#3.0使用EventLog類寫Windows事件日志的方法
- 01-10C#使用windows服務(wù)開啟應(yīng)用程序的方法
- 01-10c# ArrayList的使用方法小總結(jié)
- 01-10C#使用ADO.Net部件來訪問Access數(shù)據(jù)庫的方法
- 01-10C#使用Mutex簡單實現(xiàn)程序單實例運行的方法
- 01-10使用Nopcommerce為商城添加滿XX減XX優(yōu)惠券功能
- 01-10C#中yield用法使用說明
- 01-10C#編程和Visual Studio使用技巧(下)
- 01-10C#編程和Visual Studio使用技巧(上)


閱讀排行
本欄相關(guān)
- 01-10C#通過反射獲取當前工程中所有窗體并
- 01-10關(guān)于ASP網(wǎng)頁無法打開的解決方案
- 01-10WinForm限制窗體不能移到屏幕外的方法
- 01-10WinForm繪制圓角的方法
- 01-10C#實現(xiàn)txt定位指定行完整實例
- 01-10WinForm實現(xiàn)仿視頻播放器左下角滾動新
- 01-10C#停止線程的方法
- 01-10C#實現(xiàn)清空回收站的方法
- 01-10C#通過重寫Panel改變邊框顏色與寬度的
- 01-10C#實現(xiàn)讀取注冊表監(jiān)控當前操作系統(tǒng)已
隨機閱讀
- 04-02jquery與jsp,用jquery
- 01-10SublimeText編譯C開發(fā)環(huán)境設(shè)置
- 08-05DEDE織夢data目錄下的sessions文件夾有什
- 01-10C#中split用法實例總結(jié)
- 01-10使用C語言求解撲克牌的順子及n個骰子
- 01-10delphi制作wav文件的方法
- 01-11Mac OSX 打開原生自帶讀寫NTFS功能(圖文
- 01-11ajax實現(xiàn)頁面的局部加載
- 08-05dedecms(織夢)副欄目數(shù)量限制代碼修改
- 08-05織夢dedecms什么時候用欄目交叉功能?