日本不卡不码高清免费观看,久久国产精品久久w女人spa,黄色aa久久,三上悠亚国产精品一区二区三区

您的位置:首頁技術(shù)文章
文章詳情頁

PHP使用三種方法實現(xiàn)數(shù)據(jù)采集

瀏覽:177日期:2022-09-08 08:39:13
什么叫采集?

就是使用PHP程序,把其他網(wǎng)站中的信息抓取到我們自己的數(shù)據(jù)庫中、網(wǎng)站中。

PHP制作采集的技術(shù)

從底層的socket到高層的文件操作函數(shù),一共有3種方法可以實現(xiàn)采集。

1. 使用socket技術(shù)采集:

socket采集是最底層的,它只是建立了一個長連接,然后我們要自己構(gòu)造http協(xié)議字符串去發(fā)送請求。

例如要想獲取這個頁面的內(nèi)容,http://tv.youku.com/?spm=a2hww.20023042.topNav.5~1~3!2~A,用socket寫如下:

<?php//連接,$error錯誤編號,$errstr錯誤的字符串,30s是連接超時時間$fp=fsockopen('www.youku.com',80,$errno,$errstr,30);if(!$fp) die('連接失敗'.$errstr); //構(gòu)造http協(xié)議字符串,因為socket編程是最底層的,它還沒有使用http協(xié)議$http='GET /?spm=a2hww.20023042.topNav.5~1~3!2~A HTTP/1.1rn'; // rn表示前面的是一個命令$http.='Host:www.youku.comrn'; //請求的主機$http.='Connection:closernrn'; // 連接關(guān)閉,最后一行要兩個rn //發(fā)送這個字符串到服務(wù)器fwrite($fp,$http,strlen($http));//接收服務(wù)器返回的數(shù)據(jù)$data=’’;while (!feof($fp)) {$data.=fread($fp,4096); //fread讀取返回的數(shù)據(jù),一次讀取4096字節(jié)}//關(guān)閉連接fclose($fp);var_dump($data);?>

打印出的結(jié)果如下,包含了返回的頭信息及頁面的源碼:

PHP使用三種方法實現(xiàn)數(shù)據(jù)采集

2. 使用curl_一套函數(shù)

curl把HTTP協(xié)議都封裝成了很多函數(shù),直接傳相應(yīng)參數(shù)即可,降低了編寫HTTP協(xié)議字符串的難度。

前提:在php.ini中要開啟curl擴展。

//生成一個curl對象$curl=curl_init();//設(shè)置URL和相應(yīng)的選項curl_setopt($curl, CURLOPT_URL, 'http://www.youku.com');curl_setopt($curl, CURLOPT_RETURNTRANSFER, 1); //將curl_exec()獲取的信息以字符串返回,而不是直接輸出。//執(zhí)行curl操作$data=curl_exec($curl);var_dump($data);

打印出的結(jié)果如下,只包含頁面的源碼:

PHP使用三種方法實現(xiàn)數(shù)據(jù)采集

3. 直接使用file_get_contents(最頂層的)

前提:在php.ini中設(shè)置允許打開一個網(wǎng)絡(luò)的url地址。

PHP使用三種方法實現(xiàn)數(shù)據(jù)采集

//使用file_get_contents()$data=file_get_contents('http://www.youku.com');var_dump($data);

PHP使用三種方法實現(xiàn)數(shù)據(jù)采集

3種方式的選擇

網(wǎng)絡(luò)之間通信主要使用的是以上三種。其中后兩種用的較多:如果要批量采集大量的數(shù)據(jù)時使用第二種【CURL】,性能好、穩(wěn)定。

偶爾發(fā)幾個請求發(fā)的頻繁不密集時使用第三種。

擴展:圖片的防盜鏈如何破?

比如7060網(wǎng)站上的圖片做了防盜鏈:在他的網(wǎng)站中可以看到圖片,把圖片拿到站外就無法訪問。

PHP使用三種方法實現(xiàn)數(shù)據(jù)采集

原理:在HTTP協(xié)議中有一個referer項,代表發(fā)這個請求的來源地址,服務(wù)器會判斷如果這個請求不是這個網(wǎng)站發(fā)來的就會過濾掉這個請求:

PHP使用三種方法實現(xiàn)數(shù)據(jù)采集

解決辦法:發(fā)HTTP時自己模擬referer即可:

PHP使用三種方法實現(xiàn)數(shù)據(jù)采集

擴展:有些要采集數(shù)據(jù)時時必須先登錄,可以使用模擬的試模擬在登錄狀態(tài)下的采集:

a. 先用瀏覽登錄一下,登錄完,瀏覽器的COOKIE中就會有SESSIONID

b. 發(fā)PHP發(fā)HTTP協(xié)議時,把瀏覽器中的SESSIONID放到PHP的HTTP協(xié)議請求里,這樣就在以登錄的狀態(tài)發(fā)請求。

總結(jié):所有客戶端發(fā)過來的數(shù)據(jù)都可以被模擬,所以服務(wù)器上的程序必須要必要的地方過濾客戶端的數(shù)據(jù)。

什么時候用以上東西?接口開發(fā)時、采集時。

數(shù)據(jù)采集

例如我要采集這個url里的所有美國電影的信息,

http://list.youku.com/category/show/c_96_a_%E7%BE%8E%E5%9B%BD_s_1_d_1_p_3.html

則先要知道電影所在的節(jié)點的結(jié)構(gòu),我們使用firebug查看。

PHP使用三種方法實現(xiàn)數(shù)據(jù)采集

然后開始寫代碼:完整代碼如下

/** * 發(fā)一個GET請求獲取數(shù)據(jù) */function get($url){ global $curl; // 配置curl中的http協(xié)議->可配置的薦可以查PHP手冊中的curl_ curl_setopt($curl, CURLOPT_URL, $url); curl_setopt($curl, CURLOPT_RETURNTRANSFER, TRUE); curl_setopt($curl, CURLOPT_HEADER, FALSE); // 執(zhí)行這個請求 return curl_exec($curl);} // 生成一個curl對象$curl = curl_init();$url=’http://list.youku.com/category/show/c_96_a_%E7%BE%8E%E5%9B%BD_s_1_d_1_p_3.html’;$data=get($url);// 匹配電影所在位置$list_preg = ’/<li class='yk-col4 mr1'>.+</li>/Us’;// 匹配img標(biāo)簽上的src和alt$img_preg = ’/<img _src='(.*)' src='http://www.b3g6.com/bcjs/(.*)' alt='(.*)' />/U’;//匹配電影的url$video_preg=’/<a href='http://www.b3g6.com/bcjs/(.*)' rel='external nofollow' target='(.*)'></a>/U’;//把所有的li存到$list里,$list是個二維數(shù)組preg_match_all($list_preg,$data,$list); //var_dump($list);foreach ($list[0] as $k => $v) { //這里$v就是每一個li標(biāo)簽/* 獲取圖片及電影名稱 preg_match($img_preg,$v,$img); //把匹配到的圖片的信息存到$img里 var_dump($img); */ /*獲取電影地址 preg_match($video_preg,$v,$video); //把匹配到的電影的信息存到$video里 var_dump($video);*/ preg_match($img_preg,$v,$img); preg_match($video_preg,$v,$video); echo $img[0].’<a href='http://www.b3g6.com/bcjs/’.$video[1].’' rel='external nofollow' >’.$video[2].’</a>’;}

測試:

打印$list;

PHP使用三種方法實現(xiàn)數(shù)據(jù)采集

打印$img

PHP使用三種方法實現(xiàn)數(shù)據(jù)采集

打印$video

PHP使用三種方法實現(xiàn)數(shù)據(jù)采集

最終效果:

PHP使用三種方法實現(xiàn)數(shù)據(jù)采集

如果需要把圖片拷貝到硬盤上,則在foreach循環(huán)里加上以下代碼:

$imgData = get($img[1]); // 把圖片文件寫到硬盤上【下載】 // 因為操作系統(tǒng)是GBK的,所以要把UTF8轉(zhuǎn)成GBK is_dir(’./youkuimg/’) ? ’’: mkdir(’./youkuimg/’);file_put_contents(’./youkuimg/’.mb_convert_encoding($img[3], ’gbk’, ’utf-8’).’.jpg’, $imgData);

PHP使用三種方法實現(xiàn)數(shù)據(jù)采集

效果如下:在當(dāng)前目錄下的youkuimg目錄下就會有下載好的圖片。

PHP使用三種方法實現(xiàn)數(shù)據(jù)采集

以上就是PHP使用三種方法實現(xiàn)數(shù)據(jù)采集的詳細(xì)內(nèi)容,更多關(guān)于PHP使數(shù)據(jù)采集的資料請關(guān)注好吧啦網(wǎng)其它相關(guān)文章!

標(biāo)簽: PHP
相關(guān)文章:
日本不卡不码高清免费观看,久久国产精品久久w女人spa,黄色aa久久,三上悠亚国产精品一区二区三区
99精品在线| 人人香蕉久久| 国产一区二区三区四区五区传媒| 国产成人免费| 精品三区视频| 成人在线视频免费| 国产夫妻在线| 岛国av在线网站| 国产在线观看91一区二区三区| 日韩高清中文字幕一区| 日韩三级视频| 日韩国产91| 国产一区二区三区四区五区传媒| 久久精品国产99| 久久国产主播| 国产一区亚洲| 亚洲高清成人| 亚洲欧洲一区二区天堂久久| 日韩视频不卡| 日韩欧美中文字幕在线视频| 午夜久久av | 激情久久五月| 性色一区二区| 欧美专区一区| 黄色在线网站噜噜噜| 伊人久久视频| 久久午夜影视| 美女高潮久久久| 女同性一区二区三区人了人一| 日本天堂一区| 国产一区视频在线观看免费| 亚洲免费成人av在线| 另类专区亚洲| 亚洲aa在线| 一本一道久久a久久精品蜜桃| 97久久精品| 日韩在线不卡| 国产日韩视频在线| 久久网站免费观看| 日韩精品视频中文字幕| 久久久久国产精品一区三寸| 日韩av网站在线免费观看| 亚洲性色av| 国产精品sm| 亚洲伊人精品酒店| 欧美成a人国产精品高清乱码在线观看片在线观看久| 精品欧美久久| 中文字幕人成乱码在线观看| 国产精选久久| 日韩精品导航| 蜜臀91精品一区二区三区| 久久中文字幕一区二区三区| 亚洲制服欧美另类| 一区免费在线| 日韩有吗在线观看| 午夜亚洲福利| 秋霞国产精品| 蜜桃av一区二区| 午夜国产精品视频免费体验区| 日本不卡免费高清视频在线| 精品国产中文字幕第一页| 国产伦精品一区二区三区视频| 日韩精品国产精品| 日韩二区三区在线观看| 欧美视频久久| 国产欧美二区| 在线免费观看亚洲| 性欧美长视频| 亚洲日本久久| 国产精品久久久久久久久久妞妞 | 免费看欧美美女黄的网站| 99精品视频精品精品视频| 九色porny丨国产首页在线| 国产一区二区三区四区五区| 成人一区不卡| 免费视频一区三区| 亚洲欧美日韩视频二区| 亚洲ab电影| 国产精品亚洲综合久久| 精品视频国内| 久久精品免视看国产成人| 免费看黄色91| 欧美色图一区| 免费不卡中文字幕在线| 五月激情久久| 精品美女久久| 色婷婷综合网| 亚洲无线一线二线三线区别av| 亚洲激情欧美| 男女男精品网站| 日韩中文字幕不卡| 中文一区在线| 久久免费福利| 99久久99久久精品国产片果冰| 亚洲最新无码中文字幕久久| аⅴ资源天堂资源库在线| 久久99国产精品视频| 欧产日产国产精品视频| 久久久9色精品国产一区二区三区| 久久精品一区| 激情视频一区二区三区| 欧美日韩国产欧| 在线一区二区三区视频| 精品亚洲成人| 欧美一区二区三区激情视频| 野花国产精品入口| 久久精品人人| 欧美专区18| 91成人在线网站| 岛国av在线播放| 天堂va蜜桃一区二区三区| **爰片久久毛片| 亚洲不卡av不卡一区二区| 嫩呦国产一区二区三区av| 西西人体一区二区| 精品一区二区男人吃奶| 亚洲精品电影| 97欧美在线视频| 四虎精品永久免费| 欧美国产美女| 欧美一级二级视频| 亚洲激情偷拍| 精品国产a一区二区三区v免费| 国产99久久| 国产精品**亚洲精品| 国产视频一区三区| 成人免费电影网址| 精品一区二区三区免费看 | 日韩中文字幕av电影| 精品视频97| 久久成人高清| 欧美精品二区| 精品视频亚洲| 欧美激情另类| 欧美精品日日操| 国产suv精品一区二区四区视频 | 国产日本久久| 麻豆一区在线| 成人在线观看免费视频| 精品国产免费人成网站| 日韩国产在线| 91精品成人| 男女性色大片免费观看一区二区| 中文字幕av亚洲精品一部二部| 亚洲1区在线| 免费在线日韩av| 麻豆国产精品| 欧美好骚综合网| 99在线精品视频在线观看| 亚洲专区视频| 成人午夜亚洲| 亚洲一区二区成人| 国产精品中文字幕制服诱惑| 精品亚洲免a| 在线亚洲观看| 久久免费福利| 午夜欧美精品| 久久99蜜桃| 99综合视频| 精品美女在线视频| 亚洲久久视频| caoporn视频在线| 尤物网精品视频| 麻豆免费精品视频| 午夜影院欧美| 国产成人精品一区二区免费看京| 蘑菇福利视频一区播放| 精品久久网站| 日日夜夜免费精品视频| 国产欧美久久一区二区三区| 久久精品国产免费| 久久理论电影| 麻豆国产91在线播放| 国产一区亚洲| 欧美日韩夜夜| 不卡视频在线| 久久麻豆视频| 蘑菇福利视频一区播放| 涩涩av在线| 国产精品久久久久久久久免费高清| 欧美日韩日本国产亚洲在线| 麻豆免费精品视频| 国产亚洲久久| 日韩av影院| 亚洲bt欧美bt精品777| 亚洲免费黄色| 免费中文字幕日韩欧美| 99久久久久国产精品| 精品久久久中文字幕| 久久av日韩| 国产精品超碰| 国产高清日韩| 亚洲久草在线| 亚洲精品美女91| 亚洲一区二区三区无吗| 丝袜诱惑制服诱惑色一区在线观看| 日本少妇一区| av在线日韩| 亚洲午夜av| 午夜在线播放视频欧美|