阅读(3.4k) 书签赞(1) 我要纠错

lxml 文本获取

2021-05-28 10:14 更新

我们用XPath中的text()方法获取节点中的文本

from lxml import etree

text='''
<div>
    <ul>
         <li class="item-0"><a href="link1.html">第一个</a></li>
         <li class="item-1"><a href="link2.html">second item</a></li>
     </ul>
 </div>
'''

html=etree.HTML(text,etree.HTMLParser())
result=html.xpath('//li[@class="item-1"]/a/text()') #获取a节点下的内容
result1=html.xpath('//li[@class="item-1"]//text()') #获取li下所有子孙节点的内容

print(result)
print(result1)

属性获取

使用@符号即可获取节点的属性，如下：获取所有li节点下所有a节点的href属性

result=html.xpath('//li/a/@href')  #获取a的href属性
result=html.xpath('//li//@href')   #获取所有li子孙节点的href属性

以上内容是否对您有帮助：

← lxml 属性匹配

lxml 属性多值匹配 →

写笔记

我要补充

lxml 文本获取

属性获取

推荐文章

推荐教程

推荐课程