[精讚] [會員登入]
1764

來自網路的爬蟲分析

分析最近來自網路上的爬蟲

分享此文連結 //n.sfs.tw/12812

分享連結 來自網路的爬蟲分析@新精讚
(文章歡迎轉載,務必尊重版權註明連結來源)
2019-10-24 23:31:38 最後編修
2018-10-13 01:48:15 By 張○○
 

自動目錄

我好奇分析了精讚最近的180萬次訪客記錄。

資料是自有的,並非來自 google analytics之類的記錄,同時也有過濾掉三天內重複的來源。

訪客來源

爬蟲或機器人比正常人來得多,從數據分析可看出53%是屬於爬蟲或機器人,可能是人類的比例約為47%。

有些擬人類的爬蟲或機器人可能混進來,因此實際比例可能人類更少。

 

爬蟲的來源

我分析出的爬蟲大約有50-100種之多(事實上可能更多),某些偶爾來幾次的爬蟲就直接歸納到其它項目中,分析出前幾大爬蟲數量和所占爬蟲的比例

前幾大中排第一名的是 google的爬蟲。

第二名的 ahrefsbot https://ahrefs.com/robot ;;; 不知是什麼來頭的公司

第三名是微軟的 bing

第四名是semrush https://www.semrush.com/bot/

此四大爬蟲就約占了爬蟲來源的 79%,也就是說這四隻是超級大爬蟲。

 

爬蟲的來訪對網站的曝光是好事,但會吃掉不少頻寬也是壞事。

還好網站當初在建置的時候我就有考慮過,只要是被判定是爬蟲的來源,在「正被關注」的地方會標注一個大寫的B,表示我知道你的來訪,但是不會列入點擊次數。

 

裝置的來源

藉由 google的分析這近12個月的資料,可以知道本站有約 31.6+1.9=33.5(%)的使用者是來自於行動裝置

 

以上是簡單的分析資料,大概知道就好。By Alexa 的分析 https://www.alexa.com/siteinfo/sfs.tw

到目前為止本站的排名約

參考參考。

END

你可能感興趣的文章

台灣佳光(台數科)、群健有線寬頻使用心得 我的台灣佳光(已改名台數科)、群健有線(TBC)'、中華電光世代ADSL、企業專線寬頻使用心得(台中)

網路是平的?所以競爭來自四面八方! 在二十世紀末的時候,網際網路的出現改變了這個世界。但不表示你可以分一杯羹。

如何開啟 .sqlite 的檔 如何開啟 .sqlite 的檔?

使用大頭貼網站 Gravatar 使用全球公開的大頭貼網站,帶來更多的方便

avif類型的圖檔?那是什麼?比jpg好嗎? 圖檔格式不是只有jpg png gif,還有比webp更新的avif,那是什麼?

我有六顆硬碟,該設定 RAID5, RAID50 還是 RAID6? 我有六顆硬碟,該設定 RAID5, RAID50 還是 RAID6?

隨機好文

問問題 問問題其實內涵很深,我悟了很久才懂。 有人問題的目的並不一定是想要得到答案,有時只是純粹想問問題..

[大型機台] 熱血高校躲避球 多少少年時光歲月耗在這個遊戲上,二十幾年前的那個時光,唯一想做的事就是把吃飯錢省下來拿去打一場五塊錢的電動,就算是沒錢也

[Mysql/MariaDB] 查看資料庫所占空間 查看資料庫在磁碟中所占空間

[Apache] 自訂錯誤頁面及移掉歡迎頁 Apache 有一個歡迎頁,以正式網站來說,出現這頁有點不專業,該移除它..

FTP的主動模式及被動模式 FTP的服務常會被防火牆擋掉,所以對於主動和被動模式,需要很了解