爬虫

Python爬虫入门抓取豆瓣内容二

1.问题分析我们在上一节爬取了网页的全部信息,下面我们还要这样html代码中找到我们所需要的内容,因此我们要根据问题进入网站中,去解析网页中的信息。从页面中可以发现,我们需要爬取的信息分别存在于不同的分区当中,那么我们来检查一下页面的元素,右键页面检查网页源代码或者F12。

Python窗口程序实现翻译器二

1.网页分析首先要选择一个翻译网站,在这里我们选择有道翻译,进入网站:http://fanyi.youdao.com/然后检查元素,这里我们直接在network中可能找不到相应信息,我们在输入框中输入随机内容,然后点击翻译,这时就会发生变化。

Python正则表达式(1)

在学习爬虫的过程中,正则表达式能够帮助我们根据某些复杂的规则去处理复杂的字符串,它是一个特殊的字符序列,在Python中,系统自带的re模块包含了正则表达式的全部功能,下面我们进入正则表达式的学习。1.元字符正则表达式的结构由普通字符和元字符组成,

Python爬虫技术基础(1)-网络请求

我们在使用爬虫的时候离不开URL地址和下载页面,首先我们就来了解一下URL。它的语法格式一般为:protocol://hostname[:port]/path/[;parameters][?query]#fragmentURL由三部分组成,第一部分是协议,

BeautifulSoup(1)

BeautifulSoup在Python中是一个比较受欢迎的第三方库,它是一款比较优秀的网页解析库,里面提供了很多接口帮助我们来处理导航、搜索、修改分析树,它的查找提取功能非常好用,能够节省程序员大量的时间。BeautifulSoup最新版为BeautifulSoup4,