Python

Python贪心算法

贪心算法也被称为贪婪算法,它是指在对问题求解时,总是做出在当前看来是最好的选择。也就是说,不从整体最优上加以考虑,他所做出的是在某种意义上的局部最优解。贪心算法不是对所有问题都能得到整体最优解,关键是贪心策略的选择,选择的贪心策略必须具备无后效性,

Python试探算法

试探算法也称为回溯算法,它实际上是一个类似枚举的搜索尝试过程,主要是在搜索尝试过程中寻找问题的解,当发现已不满足求解条件时,就“回溯”返回,尝试别的路径。回溯法是一种选优搜索法,按选优条件向前搜索,以达到目标。但当探索到某一步时,发现原先选择并不优或达不到目标,

Python爬虫概述

网络爬虫(又称为网页蜘蛛,网络机器人,更经常的称为网页追逐者),它按照一定的规则自动地抓取网络信息。1.产生背景随着时代的进步,互联网上拥有大量的信息,但是我们该如何高效的获取这些信息成为了一个挑战,传统的搜索引擎可以帮助我们解决部分问题,但是具有一定的局限性:1)不同领域、不同背景的用户往往具有不同

Python爬虫协议

当我们真正接触了爬虫之后会发现爬虫的功能十分强大,但是我们并不能为所欲为的使用爬虫,爬虫需要遵循robots协议,该协议是国际互联网界通行的道德规范,每一个爬虫都应该遵守,本节我们就来介绍一下爬虫协议。1.违规案例(1)——BE违规抓取eBay十二年前,

Python爬虫技术基础(1)-网络请求

我们在使用爬虫的时候离不开URL地址和下载页面,首先我们就来了解一下URL。它的语法格式一般为:protocol://hostname[:port]/path/[;parameters][?query]#fragmentURL由三部分组成,第一部分是协议,

Python爬虫技术基础(2)-headers处理及网络超时

有时我们发送的网络请求可能会被服务器拒绝这可能是该网站设置了反爬虫机制来防止用户恶意采集信息,但这不代表我们不能访问该网站,我们可以模拟服务器的头部信息去访问。1.请求headers处理我们首先打开我们要访问的网站,然后根据浏览器的打开方式进入检查页面,

Python正则表达式(1)

在学习爬虫的过程中,正则表达式能够帮助我们根据某些复杂的规则去处理复杂的字符串,它是一个特殊的字符序列,在Python中,系统自带的re模块包含了正则表达式的全部功能,下面我们进入正则表达式的学习。1.元字符正则表达式的结构由普通字符和元字符组成,

Python正则表达式(2)

本节我们来学习Python的内置re模块,re模块用于实现正则表达的操作,它里面提供了很多方法,例如search()、match()、findall()、split()、sub()等,下面我们依次进行学习。1.search()方法search方法在输入的字符串中查找,

BeautifulSoup(1)

BeautifulSoup在Python中是一个比较受欢迎的第三方库,它是一款比较优秀的网页解析库,里面提供了很多接口帮助我们来处理导航、搜索、修改分析树,它的查找提取功能非常好用,能够节省程序员大量的时间。BeautifulSoup最新版为BeautifulSoup4,

BeautifulSoup(2)

1.遍历文档树在解析文档文件的过程中,如果需要遍历文档,我们需要使用到一些特殊的方法。例如:1).contents获取Tag的所有子节点,以列表的形式返回。例如:con=soup.head.contentsforiincon:print(i)先把tag的.content对象以列表的形式存储在con中,