1. 引言
在 web 开发和数据采集工作中,经常需要从 html 页面中提取信息。虽然 html 解析库(如 beautifulsoup、jsoup、htmlagilitypack 等)是更稳妥的选择,但在某些轻量场景下,使用正则表达式解析 html 仍然是一种快速、直接的方案。本文将从基础概念出发,介绍如何使用正则表达式解析 html,并给出常见场景的实用示例。
2. 正则表达式基础回顾
在开始解析 html 之前,先回顾几个常用的正则表达式语法元素:
- 字符类:
[a-z]匹配任意小写字母,[0-9]匹配任意数字。 - 量词:
*表示零次或多次,+表示一次或多次,?表示零次或一次。 - 分组:使用圆括号
()捕获匹配的子串。 - 非贪婪匹配:在量词后加
?,如.*?,表示尽可能少地匹配字符。 - 转义字符:
\.匹配点号,\/匹配斜杠。
解析 html 时,最常用的是非贪婪匹配和分组捕获,因为它们能精准提取标签之间的内容。
3. 解析 html 的常见场景
下面通过几个典型场景,演示如何使用正则表达式从 html 中提取信息。
3.1 提取链接和文本
假设有一段 html 包含多个链接,需要提取每个链接的 url 和锚文本:
import re
html = '''
<a href="https://example.com/page1" rel="external nofollow" >第一篇文章</a>
<a href="https://example.com/page2" rel="external nofollow" >第二篇文章</a>
'''
pattern = r'<a href="([^" rel="external nofollow" ]+)">([^<]+)</a>'
matches = re.findall(pattern, html)
for url, text in matches:
print(f"url: {url}, 文本: {text}")这里 ([^"]+) 捕获 href 属性值,([^<]+) 捕获标签内的文本内容。
3.2 提取图片地址
提取 <img> 标签中的 src 属性:
import re html = ''' <img src="/images/logo.png" alt="网站logo" /> <img src="/images/banner.jpg" alt="横幅" /> ''' pattern = r'<img[^>]+src="([^"]+)"' srcs = re.findall(pattern, html) print(srcs) # ['/images/logo.png', '/images/banner.jpg']
3.3 提取表格数据
从简单的 html 表格中提取每一行的单元格内容:
import re
html = '''
<table>
<tr><td>姓名</td><td>年龄</td></tr>
<tr><td>张三</td><td>25</td></tr>
<tr><td>李四</td><td>30</td></tr>
</table>
'''
rows = re.findall(r'<tr>(.*?)</tr>', html, re.s)
for row in rows:
cells = re.findall(r'<td>(.*?)</td>', row)
print(cells)这里使用 re.s 标志,让点号也能匹配换行符,从而正确处理跨行的表格内容。
4. 正则表达式解析 html 的注意事项
虽然正则表达式可以完成简单的 html 解析,但在实际使用中需要注意以下几点:
- html 结构不规范:真实网页中标签经常不闭合、属性顺序不固定,正则表达式容易匹配失败。
- 嵌套标签问题:正则表达式难以处理嵌套结构,例如
<div>内部再嵌套<div>。 - 性能问题:对大型 html 文档使用复杂的正则表达式可能导致性能下降。
- 转义繁琐:html 中的特殊字符需要大量转义,代码可读性较差。
因此,对于结构复杂或不可控的 html,建议优先使用专门的解析库;正则表达式更适合处理格式相对固定、结构简单的片段。
5. 总结
本文介绍了如何使用正则表达式解析 html,包括提取链接、图片地址和表格数据等常见场景,并总结了使用正则表达式解析 html 的优缺点。在实际项目中,应根据 html 的复杂程度选择合适的工具:简单场景用正则表达式快速解决,复杂场景则交给专业的 html 解析库。
以上就是使用正则表达式解析html的实用指南的详细内容,更多关于使用正则表达式解析html的资料请关注代码网其它相关文章!
发表评论