专栏名称: Python开发者
人生苦短,我用 Python。伯乐在线旗下账号「Python开发者」分享 Python 相关的技术文章、工具资源、精选课程、热点资讯等。
目录
相关文章推荐
Python爱好者社区  ·  蚂蚁集团发布全员信:薪资大调整。 ·  昨天  
Python爱好者社区  ·  字节程序员过年回家被亲戚鄙视:你985在互联 ... ·  3 天前  
Python爱好者社区  ·  多模态,杀疯了! ·  2 天前  
Python爱好者社区  ·  yyds!《LLM书》PDF ·  昨天  
Python爱好者社区  ·  卧槽,这就是最牛逼的python教程 ·  3 天前  
51好读  ›  专栏  ›  Python开发者

Python 爬虫之 BeautifulSoup

Python开发者  · 公众号  · Python  · 2017-06-13 19:59

正文

点击 上方蓝字 ,快速关注我们)


来源:chenjiabing666

chenjiabing666.github.io/2017/04/29/python爬虫之BeautifulSoup/

如有好文章投稿,请点击 → 这里了解详情


简介


Beautiful Soup提供一些简单的、python式的函数用来处理导航、搜索、修改分析树等功能。它是一个工具箱,通过解析文档为用户提供需要抓取的数据,因为简单,所以不需要多少代码就可以写出一个完整的应用程序。Beautiful Soup自动将输入文档转换为Unicode编码,输出文档转换为utf-8编码。你不需要考虑编码方式,除非文档没有指定一个编码方式,这时,Beautiful Soup就不能自动识别编码方式了。然后,你仅仅需要说明一下原始编码方式就可以了。


Beautiful Soup已成为和lxml、html6lib一样出色的python解释器,为用户灵活地提供不同的解析策略或强劲的速度。


安装


pip install BeautifulSoup4

easy_install BeautifulSoup4


创建BeautifulSoup对象


首先应该导入BeautifulSoup类库


from bs4 import BeautifulSoup


下面开始创建对像,在开始之前为了方便演示,先创建一个html文本,如下:


html = """

The Dormouse's story

The Dormouse's story

Once upon a time there were three little sisters; and their names were

,

Lacie and

Tillie ;

and they lived at the bottom of a well.

...

"""


创建对象:soup=BeautifulSoup(html,’lxml’),这里的lxml是解析的类库,目前来说个人觉得最好的解析器了,一直在用这个,安装方法:


pip install lxml


Tag


Tag就是html中的一个标签,用BeautifulSoup就能解析出来Tag的具体内容,具体的格式为soup.name,其中name是html下的标签,具体实例如下:


print soup . title # 输出title标签下的内容,包括此标签,这个将会输出 The Dormouse's story

print soup . head


注意:


这里的格式只能获取这些标签的第一个,后面会讲到获取多个标签的方法。其中对于Tag有两个重要的属性name和attrs,分别表示名字和属性,介绍如下:


  • name:对于Tag,它的name就是其本身,如soup.p.name就是p

  • attrs是一个字典类型的,对应的是属性-值,如print soup.p.attrs,输出的就是{‘class’: [‘title’], ‘name’: ‘dromouse’},当然你也可以得到具体的值,如print soup.p.attrs[‘class’],输出的就是[title]是一个列表的类型,因为一个属性可能对应多个值,当然你也可以通过get方法得到属性的,如:print soup.p.get(‘class’)。还可以直接使用print soup.p[‘class’]


get


get方法用于得到标签下的属性值,注意这是一个重要的方法,在许多场合都能用到,比如你要得到 标签下的图像url,那么就可以用soup.img.get(‘src’),具体解析如下:


print soup.p.get("class") #得到第一个p标签下的src属性


string


得到标签下的文本内容,只有在此标签下没有子标签,或者只有一个子标签的情况下才能返回其中的内容,否则返回的是None具体实例如下:


print soup . p . string #在上面的一段文本中p标签没有子标签,因此能够正确返回文本的内容

print soup . html . string #这里得到的就是None,因为这里的html中有很多的子标签


get_text()


可以获得一个标签中的所有文本内容,包括子孙节点的内容,这是最常用的方法


搜索文档树


find_all( name , attrs , recursive , text , **kwargs )


find_all是用于搜索节点中所有符合过滤条件的节点


1. name参数:是Tag的名字,如p,div,title …..


soup.find_all("p") 查找所有的p标签,返回的是[ The Dormouse's story ],可以通过遍历获取每一个节点,如下:


ps = soup . find_all ( "p" )

for p in ps :

print p . get ( 'class' ) #得到p标签下的class属性


传入正则表达式:soup.find_all(re.compile(r’^b’)查找以b开头的所有标签,这里的body和b标签都会被查到


传入类列表:如果传入列表参数,BeautifulSoup会将与列表中任一元素匹配的内容返回.下面代码找到文档中所有 标签和 标签


soup.find_all(["a", "b"])


2. KeyWords参数,就是传入属性和对应的属性值,或者一些其他的表达式


  • soup.find_all(id='link2'),这个将会搜索找到所有的id属性为link2的标签。传入正则表达式soup.find_all(href=re.compile("elsie")),这个将会查找所有href属性满足正则表达式的标签

  • 传入多个值:soup.find_all(id='link2',class_='title') ,这个将会查找到同时满足这两个属性的标签,这里的class必须用class_传入参数,因为class是python中的关键词

  • 有些属性不能通过以上方法直接搜索,比如html5中的data-*属性,不过可以通过attrs参数指定一个字典参数来搜索包含特殊属性的标签,如下:


# [

foo!
]

data_soup . find_all ( attrs = { "data-foo" : "value" }) #注意这里的atts不仅能够搜索特殊属性,亦可以搜索普通属性

soup . find_all ( "p" , attrs = { 'class' : 'title' , 'id' : 'value' }) #相当与soup.find_all('p',class_='title',id='value')


3. text参数:通过 text 参数可以搜搜文档中的字符串内容.与 name 参数的可选值一样, text 参数接受 字符串 , 正则表达式 , 列表, True


soup . find_all ( text = "Elsie" )

# [u'Elsie']

soup . find_all ( text = [ "Tillie" , "Elsie" , "Lacie" ])

# [u'Elsie', u'Lacie', u'Tillie']

soup . find_all ( text = re . compile (







请到「今天看啥」查看全文