python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

数据是决策的原材料,高质量的数据价值不菲,如何挖掘原材料成为互联网时代的先驱,掌握信息的源头,就能比别人更快一步。

大数据时代,互联网成为大量信息的载体,机械的复制粘贴不再实用,不仅耗时费力还极易出错,这时爬虫的出现解放了大家的双手,以其高速爬行、定向抓取资源的能力获得了大家的青睐。

爬虫变得越来越流行,不仅因为它能够快速爬取海量的数据,更因为有python这样简单易用的语言使得爬虫能够快速上手

对于小白来说,爬虫可能是一件非常复杂、技术门槛很高的事情,但掌握正确的方法,在短时间内做到能够爬取主流网站的数据,其实非常容易实现,但建议你从一开始就要有一个具体的目标。

在目标的驱动下,你的学习才会更加精准和高效。那些所有你认为必须的前置知识,都是可以在完成目标的过程中学到的。

基于python爬虫,我们整理了一个完整的学习框架:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

可以用ForeSpider数据采集系统试一下,系统已将框架都搭建好,直接根据网页结构进行相应配置即可,还有大量实战教程可以参考。这是采集新浪财经上市公司高管信息的教程,可供您参考。

采集网站

【场景描述】采集新浪财经所有行业板块中上市公司的高管信息。

【源网站介绍】

新浪财经,提供7X24小时财经资讯及全球金融市场报价,覆盖股票、债券、基金、期货、信托、理财、管理等多种面向个人和企业的服务。

【使用工具】前嗅ForeSpider数据采集系统

【入口网址】

http://finance.sina.com.cn/stock/sl/#sinaindustry_1

【采集内容】

采集新浪财经所有行业板块中上市公司的高管信息。

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

【采集效果】如下图所示:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

l 思路分析

配置思路概览:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

l 配置步骤

1. 新建采集任务

选择【采集配置】,点击任务列表右上方【+】号可新建采集任务,将采集入口地址填写在【采集地址】框中,【任务名称】自定义即可,点击下一步。

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

选择列表链接,点击完成按钮,即创建任务完成。

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

2.获取行业链接

①用浏览器打开该网页,查看各行业的链接规律,发现行业链接规律为:http://vip.stock.finance.sina.com.cn/mkt/#new_+行业名称首字母

比如:

http://vip.stock.finance.sina.com.cn/mkt/#new_cbzz (船舶制造)

http://vip.stock.finance.sina.com.cn/mkt/#new_tchy (陶瓷行业)

②所以获取行业链接的方法为:将各行业关键词的首字母设置为关键词,用脚本拼接行业链接。

③设置关键词,具体步骤如下所示:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

关键词文本如下:

new_blhy;new_cbzz;new_cmyl;new_dlhy;new_dqhy;new_dzqj;new_dzxx;new_fdc;new_fdsb;new_fjzz;new_fzhy;new_fzjx;new_fzxl;new_glql;new_gsgq;new_gthy;new_hbhy;new_hghy;new_hqhy;new_jdhy;new_jdly;new_jjhy;new_jrhy;new_jtys;new_jxhy;new_jzjc;new_kfq;new_ljhy;new_mtc;new_mthy;new_nlmy;new_nyhf;new_qczz;new_qtxy;new_slzp;new_snhy;new_sphy;new_stock;new_swzz;new_sybh;new_syhy;new_tchy;new_wzwm;new_ylqx;new_yqyb;new_ysbz;new_ysjs;new_zhhy;new_zzhy

④高级设置,设置一个关键词参数,具体操作如下图所示:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

⑤编写关键词拼写链接的脚本:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

具体脚本文本如下:

var sear=EXTRACT.GetSearch(this); //关键词获取

var k=sear.Search();//查找关键词

while(k){ //遍历关键词

url u;//定义一个url

u.urlname="http://vip.stock.finance.sina.com.cn/mkt/#"+k.wd;//拼接行业链接

u.title="新浪行业@"+k.wd;//将标题设置为关键词名称

u.entryid=this.id;

u.tmplid=1;//关联模板1

k=sear.Search();//查找下一个关键词

RESULT.AddLink(u);//输出一个url值

}

⑥采集预览,查看行业链接是否正确。

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

3. 获取翻页链接

①观察发现,有部分行业数据量比较大,有多页数据,需要翻页。

打开【其他行业】板块,发现4页数据,点击F12,右侧出现请求,点击第二页,观察发现请求:是翻页请求链接。如下图所示

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

补充:下图为请求response转译后内容,可看出其中有第二页中的内容,故确定此链接为翻页请求链接。

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

②复制翻页请求链接:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

③同样方法,找到第三页和第四页请求链接,并复制出来。

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

④观察链接,发现规律如下图所示:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

⑤写翻页链接脚本,具体操作如下所示:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

脚本文本:

var hangye=URL.title.Right("@");//定义hangye为当前链接标题@右侧内容,即行业名称首字母

url u;//定义一个url

for(var i=1;i<=3;i++){//for循环表示翻页

u.urlname = "http://vip.stock.finance.sina.com.cn/quotes_service/api/json_v2.php/Market_Center.getHQNodeData?page="+i+"&num=80&sort=symbol&asc=1&node="+hangye;//根据翻页链接规律,拼翻页

u.title = hangye; //返回链接名称为行业

u.tmplid = 2;//关联模板2

RESULT.AddLink(u);

}

⑥采集预览,如下图所示,表示翻页链接已生成。

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

4. 采集公司链接

①在浏览器中打开几个公司链接,可发现规律为:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

②而公司id则在模板01获取到的翻页链接请求中,采集预览,在浏览器中打开任意一个翻页请求,经观察发现,这是一个json,公司id为每个对象的symbol值。

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

③新建模板02,并在其下新建一个链接抽取

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

④脚本如下所示:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

脚本文本:

var ur=URL.urlname;//定义ur变量为当前请求链接,即翻页请求链接

var doc = EXTRACT.OpenDoc(CHANN, ur, "");//打开请求

var tstr = doc.GetDom().GetSource();//打开请求中的dom树,并获取源码,定义源码为tstr

jScript js;//定义一个js

var obj = js.RunJson(tstr);//执行tstr代码并返回一个对象

for(var i=0;i<=79;i++){

var obj_a=obj[i];//定义obj_a为第i个对象

var goodsname=obj_a.symbol;

EXTRACT.CloseDoc(doc);//关闭请求

url u;

u.urlname="https://finance.sina.com.cn/realstock/company/"+goodsname+"/nc.shtml";//拼公司链接

u.title=URL.title;//将标题设置为关键词名称

u.entryid=this.id;//定义goodsname为对象中的symbol值,即公司id

u.tmplid=3;//关联模板03

RESULT.AddLink(u);

}

⑤点击采集预览,如下所示:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

5. 抽取公司高管链接

①新建一层模板03,并新建一个链接抽取。

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

②在浏览其中打开任意一个公司的链接,并再打开企业高管页面链接。

观察发现,企业高管页面链接规律为:

http://vip.stock.finance.sina.com.cn/corp/go.php/vCI_CorpManager/stockid/+公司id+.phtml

③填写脚本如下:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

④采集预览,如下所示:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

6.抽取高管链接

①新建模板04,在其下新建一个数据抽取,具体操作如下所示:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

②填写示例地址,复制任意一个企业高管链接,在下图所示位置:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

点击右上角保存后,双击模拟浏览器空白处,模拟浏览器加载出该页面。

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

③点击模板预览

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

④经观察发现,高管链接规律为,都包含:http://vip.stock.finance.sina.com.cn/corp/view/vCI_CorpManagerInfo.php?stockid=

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

⑤地址过滤,将地址中含有http://vip.stock.finance.sina.com.cn/corp/view/vCI_CorpManagerInfo.php?stockid=的链接都过滤出来。

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

7.抽取高管数据

①新建模板05,在其下新建一个数据抽取。

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

②关联模板,将模板04关联至模板05。

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

填写示例地址,将任意一个高管链接填写至如下位置:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

③新建一个数据表单,具体步骤和字段属性如下所示:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

④关联数据表单,如下图所示:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

⑤数据取值

A. uname:打开浏览器,F12,查看高管名称,发现其在源码中,如下图所示。

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

使用脚本取值,具体如下图所示:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

B. usex:使用定位取值的方法,进行取值。

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

C. ubirth:定位取值(同上)

D. Uedu:定位取值(同上)

E. Country:定位取值(同上)

F. Intro:定位取值(同上)

G. Company:定位取值(同上)

⑥采集预览

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

l 采集步骤

模板配置完成,采集预览没有问题后,可以进行数据采集。

①首先要建立采集数据表:

选择【数据建表】,点击【表单列表】中该模板的表单,在【关联数据表】中选择【创建】,表名称自定义,这里命名为【qiyegaoguan】(注意命名不能用数字和特殊符号),点击【确定】。创建完成,勾选数据表,并点击右上角保存按钮。

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

②选择【数据采集】,勾选任务名称,点击【开始采集】,则正式开始采集。

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

③采集中:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

④采集结束后,可以在【数据浏览】中,选择数据表查看采集数据,并可以导出数据。

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

⑤导出的文件打开如下图所示:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

除了网络爬虫,还有哪些方法可以采集数据?

不想花费时间,写爬虫程序。除了网络爬虫,还有哪些方法可以采集数据?

这里介绍3个非常不错的网络爬虫工具,可以自动抓取网站数据,操作简单、易学易懂,不需要编写一行代码,感兴趣的朋友可以尝试一下:

01

八爪鱼采集器

这是一个非常不错的国产网络爬虫软件,目前仅支持Windows平台,个人使用完全免费,只需简单创建任务,设置字段,就可采集大部分网页数据,内置了大量数据采集模板,可以轻松爬取天猫、京东、淘宝、大众点评等热门网站,官方自带有非常详细的入门教学文档和示例,非常适合初学者学习和掌握:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

02

后羿采集器

这是一个非常智能的网络爬虫软件,完美兼容3大操作平台,个人使用完全免费,基于人工智能技术,可以轻松识别网页中的数据,包括列表、链接、图片等,支持自动翻页和数据导出功能,对于小白使用来说,非常不错,当然,官方也自带有非常丰富的入门教程,可以帮助初学者更好的掌握和使用:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

03

火车采集器

这是一个功能强大的网络爬虫软件,在业界非常流行,也非常受欢迎,集成了数据从采集、处理、分析到挖掘的全过程,可以灵活抓取网络上任意散乱的数据(规则设置非常智能),并通过一系列准确的分析得到有价值的结果,官方自带有非常详细的使用文档和教程,初学者学习的话,很容易掌握:

python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

目前,就分享这3个不错的网络爬虫工具吧,对于日常爬取大部分网站来说,完全够用了,只要你熟悉一下使用过程,很快就能掌握的,当然,如果你了解Python等编程语言,也可以使用scrapy等框架,网上也有相关教程和资料,介绍的非常详细,感兴趣的话,可以搜一下,希望以上分享的内容能对你有所帮助吧,也欢迎大家评论、留言进行补充。

如何做大数据的数据采集?

要想了解大数据的数据采集过程,首先要知道大数据的数据来源,目前大数据的主要数据来源有三个途径,分别是物联网系统、Web系统和传统信息系统,所以数据采集主要的渠道就是这三个。python爬虫基础知识,Python爬虫和数据分析需要哪些知识储备,自学顺序是怎样的?

物联网的发展是导致大数据产生的重要原因之一,物联网的数据占据了整个大数据百分之九十以上的份额,所以说没有物联网就没有大数据。物联网的数据大部分是非结构化数据和半结构化数据,采集的方式通常有两种,一种是报文,另一种是文件。在采集物联网数据的时候往往需要制定一个采集的策略,重点有两方面,一个是采集的频率(时间),另一个是采集的维度(参数)。

Web系统是另一个重要的数据采集渠道,随着Web2.0的发展,整个Web系统涵盖了大量的价值化数据,而且这些数据与物联网的数据不同,Web系统的数据往往是结构化数据,而且数据的价值密度比较高,所以通常科技公司都非常注重Web系统的数据采集过程。目前针对Web系统的数据采集通常通过网络爬虫来实现,可以通过Python或者Java语言来完成爬虫的编写,通过在爬虫上增加一些智能化的操作,爬虫也可以模拟人工来进行一些数据爬取过程。

传统信息系统也是大数据的一个数据来源,虽然传统信息系统的数据占比较小,但是由于传统信息系统的数据结构清晰,同时具有较高的可靠性,所以传统信息系统的数据往往也是价值密度最高的。传统信息系统的数据采集往往与业务流程关联紧密,未来行业大数据的价值将随着产业互联网的发展进一步得到体现。

我从事互联网行业多年,目前也在带计算机专业的研究生,主要的研究方向集中在大数据和人工智能领域,我会陆续写一些关于互联网技术方面的文章,感兴趣的朋友可以关注我,相信一定会有所收获。

如果有互联网方面的问题,也可以咨询我,谢谢!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 xxx@163.com 举报,一经查实,本站将立刻删除。

发表评论

登录后才能评论