正则表达式和re模块02

发布时间：2020-12-14 05:47:50 所属栏目：百科来源：网络整理

导读：思维导图正则表达式定义：用定义好的字符的组合，组成一个规定字符串，用来表达对字符串的一种过滤规则正则字符： w（word）匹配字母或数字或下划线； s（space）匹配任意的空白字符； d（digit）匹配数字 W 匹配非字母或数字或下划线 D 匹配非数字

思维导图>>>

正则表达式
定义：
用定义好的字符的组合，组成一个规定字符串，用来表达对字符串的一种过滤规则
正则字符：
w（word）匹配字母或数字或下划线；
s（space）匹配任意的空白字符；
d（digit）匹配数字

W 匹配非字母或数字或下划线
D 匹配非数字
S 匹配非空白字符

n 匹配一个换行符
t 匹配一个制表符
b 匹配一个单词的结尾

a|b 匹配字符a或字符b

() 括号内的表达式也表示一个组
[...] 匹配字符组中的字符
[^...] 匹配字符组中的字符的所有字符
. 匹配出换行符外的任意字符
^匹配一个字符串的开始
$匹配一个字符串的结尾

量词

正则字符.^*举例

正则	待匹配字符	匹配结果	说明
海.	海燕海娇海东	海燕海娇海东	? 匹配所有"海."的字符
^海.	海燕海娇海东	海燕	只从开头匹配"海."
海.$	? 海燕海娇海东	海东	只匹配结尾的"海.$"

*+？的举例

正则	待匹配字符	匹配结果	说明
李.?	李杰和李莲英和李二棍子	李杰李莲李二	? ?表示重复零次或一次，即只匹配"李"后面一个任意字符 ?
李.*	李杰和李莲英和李二棍子	李杰和李莲英和李二棍子	*表示重复零次或多次，即匹配"李"后面0或多个任意字符
李.+	李杰和李莲英和李二棍子	李杰和李莲英和李二棍子	+表示重复一次或多次，即只匹配"李"后面1个或多个任意字符
李.{1,2}	李杰和李莲英和李二棍子	李杰和李莲英李二棍	{1,2}匹配1到2次任意字符

?注意：前面的*,+,?等都是贪婪匹配，也就是尽可能匹配，后面加?号使其变成惰性匹配

正则	待匹配字符	匹配结果	说明
李.*?	李杰和李莲英和李二棍子	李李李	惰性匹配

[]和[^]的举例

正则	待匹配字符	匹配结果	说明
李[杰莲英二棍子]*	李杰和李莲英和李二棍子	李杰李莲英李二棍子	? 表示匹配"李"字后面[杰莲英二棍子]的字符任意次 ?
李[^和]*	李杰和李莲英和李二棍子	李杰李莲英李二棍子	表示匹配一个不是"和"的字符任意次
[d]	456bdha3	4 5 6 3	表示匹配任意一个数字，匹配到4个结果
[d]+	456bdha3	456 3	表示匹配任意个数字，匹配到2个结果

分组 (); 或 |; [^]

正则	待匹配字符	匹配结果	说明
^[1-9]d{13,16}[0-9x]$	110101198001017032	110101198001017032	? ?表示可以匹配一个正确的身份证号
^[1-9]d{13,16}[0-9x]$	1101011980010170	1101011980010170	表示也可以匹配这串数字，但这并不是一个正确的身份证号码，它是一个16位的数字
^[1-9]d{14}(d{2}[0-9x])?$	1101011980010170	False	现在不会匹配错误的身份证号了 ()表示分组，将d{2}[0-9x]分成一组，就可以整体约束他们出现的次数为0-1次
^([1-9]d{16}[0-9x]\|[1-9]d{14})$	110105199812067023	110105199812067023	表示先匹配[1-9]d{16}[0-9x]如果没有匹配上就匹配[1-9]d{14}

转义：
在正则表达式中，有很多有特殊意义的是元字符，比如n和s等，?如果要在正则中匹配正常的"n"而不是"换行符"就需要对""进行转义，变成‘‘
需要取消多少转义，就要加多少。或者在前边直接加r

正则	待匹配字符	匹配结果	说明
n	n	?False	因为在正则表达式中是有特殊意义的字符，所以要匹配n本身，用表达式n无法匹配
n	n	?True	转义之后变成，即可匹配
"\n"	‘n‘	?True	如果在python中，字符串中的‘‘也需要转义，所以每一个字符串‘‘又需要转义一次
r‘n‘	r‘n‘	?True	在字符串之前加r，让整个字符串不转义

贪婪匹配
在满足匹配时，匹配尽可能长的字符串，默认情况下，采用贪婪匹配

正则	待匹配字符	匹配结果	说明
<.*>	<script>...<script>	<script>...<script>	默认为贪婪匹配模式，会匹配尽量长的字符串
<.*?>	r‘d‘	? <script> <script>	加上？为将贪婪匹配模式转为非贪婪匹配模式，会匹配尽量短的字符串

取消贪婪

*? 重复任意次，但尽可能少重复
+? 重复1次或更多次，但尽可能少重复
?? 重复0次或1次，但尽可能少重复
{n,m}? 重复n到m次，但尽可能少重复
{n,}? 重复n次以上，但尽可能少重复

.*？的用法

. 是任意字符
* 是取 0 至 无限长度
? 是非贪婪模式。
何在一起就是 取尽量少的任意字符，一般不会这么单独写，他大多用在：
.*?x

就是取前面任意长度的字符，直到一个x出现

re模块
三个必须掌握的方法findall、serch、match

import re
# 第一个参数是正则表达式，第二个参数是待匹配的文本内容
ret = re.findall(‘a‘,‘eva egon yuan‘) # 返回所有满足匹配条件的结果,放在列表里
print(ret)
ret = re.search(‘a‘,‘eva egon yuan‘) 
print(ret) # 结果 ： <_sre.SRE_Match object; span=(2,3),match=‘a‘>?
print(ret.group()) # 结果:‘a‘
# 函数会在字符串内查找模式匹配,直到找到第一个匹配然后返回一个包含匹配信息的对象,该对象可以通过调用group()方法得到匹配的字符串,如果字符串没有匹配，则返回None，并且需要注意的是如果ret是None，再调用.group()会直接报错。这一易错点可以通过if判断来进行筛选
if ret:
print(ret.group())
ret = re.match(‘a‘,‘abc‘).group() # 同search,不过仅在字符串开始处进行匹配
print(ret) # ‘a‘
# match是从头开始匹配，如果正则规则从头开始可以匹配上，就返回一个对象,需要用group才能显示，如果没匹配上就返回None，调用group()就会报错

其他方法

ret = re.split(‘[ab]‘,‘abcd‘) # 先按‘a‘分割得到‘‘和‘bcd‘,在对‘‘和‘bcd‘分别按‘b‘分割
print(ret) # [‘‘,‘‘,‘cd‘]
ret = re.sub(‘d‘,‘H‘,‘eva3egon4yuan4‘,1) # 将数字替换成‘H‘，参数1表示只替换1个
print(ret) # evaHegon4yuan4
ret = re.subn(‘d‘,‘eva3egon4yuan4‘) # 将数字替换成‘H‘，返回元组(替换的结果,替换了多少次)
print(ret) # (‘evaHegonHyuanH‘,3)
obj = re.compile(‘d{3}‘) #将正则表达式编译成为一个 正则表达式对象，规则要匹配的是3个数字
ret = obj.search(‘abc123456ee‘) #正则表达式对象调用search，参数为待匹配的字符串
print(ret.group()) #结果 ： 123
print(ret) # 结果 ： <_sre.SRE_Match object; span=(3,6),match=‘123‘>
import re
ret = re.finditer(‘d‘,‘ds3sy4784a‘) #finditer返回一个存放匹配结果的迭代器
print(ret) # <callable_iterator object at 0x10195f940>
print(next(ret).group()) #查看第一个结果 3
print(next(ret).group()) #查看第二个结果 4
print([i.group() for i in ret]) #查看剩余的左右结果 [‘7‘,‘8‘,‘4‘]

分组优先机制

import re
res = re.search(‘^[1-9]d{14}(d{2}[0-9x])?$‘,110105199812067023)
print(res.group())
print(res.group(1)) # 获取正则表达式括号阔起来分组的内容
print(res.group(2)) # search与match均支持获取分组内容的操作 跟正则无关是python机制
# 而针对findall它没有group取值的方法，所以它默认就是分组优先获取的结果
ret = re.findall(‘www.(baidu|oldboy).com‘,‘www.oldboy.com‘)
print(ret) # [‘oldboy‘] 这是因为findall会优先把匹配结果组里内容返回,如果想要匹配结果,取消权限即可
ret = re.findall(‘www.(?:baidu|oldboy).com‘,‘www.oldboy.com‘) # ?:取消分组优先
print(ret) # [‘www.oldboy.com‘]

补充

import re
ret = re.search("<(?P<tag_name>w+)>w+</(?P=tag_name)>","<h1>hello</h1>")
#还可以在分组中利用?<name>的形式给分组起名字
#获取的匹配结果可以直接用group(‘名字‘)拿到对应的值
print(ret.group(‘tag_name‘)) #结果 ：h1
print(ret.group()) #结果 ：<h1>hello</h1>
"""
注意?P=tag_name相当于引用之前正则表达式，并且匹配到的值必须和前面的正则表达式一模一样
"""
# 匹配整数
ret=re.findall(r"d+","1-2*(60+(-40.35/5)-(-4*3))")
print(ret) #[‘1‘,‘2‘,‘60‘,‘40‘,‘35‘,‘5‘,‘4‘,‘3‘]
ret=re.findall(r"d+.d*|(d+)",‘3‘]
ret.remove("")
print(ret) #[‘1‘,‘3‘]

（编辑：李大同）

【声明】本站内容均来自网络，其相关言论仅代表作者个人观点，不代表本站立场。若无意侵犯到您的权利，请及时与联系站长删除相关内容!