/1dreamGN/Blog

1dreamGN

正则表达式简单快速入门

2023-08-14
正则表达式简单快速入门

最近在网上看关于正则表达式的用法,因为有时候光忘记,再加上网上的内容参差不齐,让我有时候难以消化,遂后期将逐步更新此文章,让自己看的更通俗易懂。先记录下最基本的知识点

定义
正则表达式,又称规则表达式,计算机科学的一个概念。正则表达式通常被用来检索、替换那些符合某个模式(规则)的文本。

场景
用户名、密码强度、整数、数字、电子邮件地址(Email)、手机号码、身份证号、URL地址、 IPv4地址、 十六进制颜色、 日期、 QQ号码、 微信号、车牌号、中文正则。表单验证处理必备。

语法

abc+b,可以匹配 abcoob、abcooob、abcoooooob 等,+ 号代表前面的字符必须至少出现一次(1次或多次)。

abcoob,可以匹配 abcob、abcoob、abcoooooob 等, 号代表前面的字符可以不出现,也可以出现一次或者多次(0次、或1次、或多次)。

colou?r 可以匹配 color 或者 colour,? 问号代表前面的字符最多只可以出现一次(0次或1次)。

  1. 普通字符
    普通字符包括没有显式指定为元字符的所有可打印和不可打印字符。这包括所有大写和小写字母、所有数字、所有标点符号和一些其他符号。
[a-z] 表示a-z这26个小写字母

[0-9a-z] 表示0-9这10个数字和a-z这26个小写字母

[123a-h] 表示包含数字1,2,3和a-h这8个字母

[\s\S] 匹配所有。\s 是匹配所有空白符,包括换行,\S 非空白符,不包括换行。

[^ABC] 匹配除ABC以外的所有字符

.  匹配除换行符(\n、\r)之外的任何单个字符,相等于 \[^\n\r]。

\w  匹配字母、数字、下划线。等价于 \[A-Za-z0-9\_\]
  1. 非打印字符
    非打印字符也可以是正则表达式的组成部分。下表列出了表示非打印字符的转义序列:
\cx    匹配由x指明的控制字符。例如, \cM 匹配一个 Control-M 或回车符。x 的值必须为 A-Z 或 a-z 之一。否则,将 c 视为一个原义的 'c' 字符。

\f    匹配一个换页符。等价于 \x0c 和 \cL。

\n    匹配一个换行符。等价于 \x0a 和 \cJ。

\r    匹配一个回车符。等价于 \x0d 和 \cM。

\s    匹配任何空白字符,包括空格、制表符、换页符等等。等价于 [ \f\n\r\t\v]。注意 Unicode 正则表达式会匹配全角空格符。

\S    匹配任何非空白字符。等价于 [^ \f\n\r\t\v]。

\t    匹配一个制表符。等价于 \x09 和 \cI。

\v    匹配一个垂直制表符。等价于 \x0b 和 \cK。
  1. 特殊字符
    所谓特殊字符,就是一些有特殊含义的字符,如上面说的 abcoo*b 中的 ,简单的说就是表示任何字符串的意思。如果要查找字符串中的 * 符号,则需要对 * 进行转义,即在其前加一个 \,abco*ob 匹配字符串 abcoob。
    许多元字符要求在试图匹配它们时特别对待。若要匹配这些特殊字符,必须首先使字符”转义”,即,将反斜杠字符\ 放在它们前面。下表列出了正则表达式中的特殊字符:
$    匹配输入字符串的结尾位置。如果设置了 RegExp 对象的 Multiline 属性,则 $ 也匹配 '\n' 或 '\r'。要匹配 $ 字符本身,请使用 \$。

( )    标记一个子表达式的开始和结束位置。子表达式可以获取供以后使用。要匹配这些字符,请使用 \( 和 \)。

*    匹配前面的子表达式零次或多次。要匹配 * 字符,请使用 \*。

+    匹配前面的子表达式一次或多次。要匹配 + 字符,请使用 \+。

.    匹配除换行符 \n 之外的任何单字符。要匹配 . ,请使用 \. 。

[    标记一个中括号表达式的开始。要匹配 [,请使用 \[。

?    匹配前面的子表达式零次或一次,或指明一个非贪婪限定符。要匹配 ? 字符,请使用 \?。

\    将下一个字符标记为或特殊字符、或原义字符、或向后引用、或八进制转义符。例如, 'n' 匹配字符 'n'。'\n' 匹配换行符。序列 '\\' 匹配 "\",而 '\(' 则匹配 "("  。

^    匹配输入字符串的开始位置,除非在方括号表达式中使用,当该符号在方括号表达式中使用时,表示不接受该方括号表达式中的字符集合。要匹配 ^ 字符本身,请使用 \^ 。

{    标记限定符表达式的开始。要匹配 {,请使用 \{。

|    指明两项之间的一个选择。要匹配 |,请使用 \|。

4.限定符
限定符用来指定正则表达式的一个给定组件必须要出现多少次才能满足匹配。有 * 或 + 或 ? 或 {n} 或 {n,} 或 {n,m} 共6种。
正则表达式的限定符有:

*    匹配前面的子表达式零次或多次。例如,zo* 能匹配 "z" 以及 "zoo"。* 等价于{0,}。

+    匹配前面的子表达式一次或多次。例如,'zo+' 能匹配 "zo" 以及 "zoo",但不能匹配 "z"。+ 等价于 {1,}。

?    匹配前面的子表达式零次或一次。例如,"do(es)?" 可以匹配 "do" 、 "does" 中的 "does" 、 "doxy" 中的 "do" 。? 等价于 {0,1}。

{n}    n 是一个非负整数。匹配确定的 n 次。例如,'o{2}' 不能匹配 "Bob" 中的 'o',但是能匹配 "food" 中的两个 o。

{n,}    n 是一个非负整数。至少匹配n 次。例如,'o{2,}' 不能匹配 "Bob" 中的 'o',但能匹配 "foooood" 中的所有 o。'o{1,}' 等价于 'o+'。'o{0,}' 则等价于 'o*'。

{n,m}    m 和 n 均为非负整数,其中n <= m。最少匹配 n 次且最多匹配 m 次。例如,"o{1,3}" 将匹配 "fooooood" 中的前三个 o。'o{0,1}' 等价于 'o?'。请注意在逗号和两个数之间不能有空格。

5.定位符
定位符使您能够将正则表达式固定到行首或行尾。它们还使您能够创建这样的正则表达式,这些正则表达式出现在一个单词内、在一个单词的开头或者一个单词的结尾。
定位符用来描述字符串或单词的边界,^ 和 $ 分别指字符串的开始与结束,\b 描述单词的前或后边界,\B 表示非单词边界。
正则表达式的定位符有:

^    匹配输入字符串开始的位置。如果设置了 RegExp 对象的 Multiline 属性,^ 还会与 \n 或 \r 之后的位置匹配。

$    匹配输入字符串结尾的位置。如果设置了 RegExp 对象的 Multiline 属性,$ 还会与 \n 或 \r 之前的位置匹配。

\b    匹配一个单词边界,即字与空格间的位置。

\B    非单词边界匹配。