
python去除HTML标签的方法:1、“pattern.sub('',HTML)”方法;2、“BeautifulSoup(HTML,'HTML.parser')”方法;3、“response.xpath('string(.)')”方法。
本文 *** 作环境:windows7系统、python3.6.4版,DELL G3电脑。
python去除HTML标签的几种方法
import refrom bs4 import BeautifulSoupfrom lxml import etree HTML = '<p>你好</p><br/><Font>哈哈</Font><b>大家好</b>' # 方法一pattern = re.compile(r'<[^>]+>',re.S)result = pattern.sub('', HTML)print(result) <br># 方法二soup = BeautifulSoup(HTML,'HTML.parser')print(soup.get_text()) # 方法三response = etree.HTML(text=HTML)# print(dir(response))print(response.xpath('string(.)')) # 你好哈哈大家好# 你好哈哈大家好# 你好哈哈大家好【推荐:python视频教程】 总结
以上是内存溢出为你收集整理的python怎么去除html标签全部内容,希望文章能够帮你解决python怎么去除html标签所遇到的程序开发问题。
如果觉得内存溢出网站内容还不错,欢迎将内存溢出网站推荐给程序员好友。
欢迎分享,转载请注明来源:内存溢出
微信扫一扫
支付宝扫一扫
评论列表(0条)