正则表达式的梳理和练习笔记
正则表达式的重要性不言而喻,平时写的时候都是拼拼凑凑感觉还是不太好,趁着今天做一个梳理,要让正则的用法深入血液才好。
正则表达式(regular expression)描述了一种字符串匹配的模式(pattern),可以用来检查一个串是否含有某种子串、将匹配的子串替换或者从某个串中取出符合某个条件的子串等。
创建一个正则表达式节
你可以使用以下两种方法之一构建一个正则表达式:
使用一个正则表达式字面量,其由包含在斜杠之间的模式组成,如下所示:
var re = /ab+c/;
使用正则表达式字面量为正则表达式提供了脚本加载后的编译。当正则表达式保持不变时,使用此方法可获得更好的性能。
或者调用RegExp对象的构造函数,如下所示:
var re = new RegExp("ab+c");
使用构造函数为正则表达式提供了运行时的编译。使用构造函数的方式,当你知道正则表达式的模式将会改变,或者你不知道模式,并且从其他来源获取它,如用户输入。
普通字符
普通字符包括没有显式指定为元字符的所有可打印和不可打印字符。这包括所有大写和小写字母、所有数字、所有标点符号和一些其他符号。
这里的所有符号要排除一些特殊符号
非打印字符
非打印字符也可以是正则表达式的组成部分。下表列出了表示非打印字符的转义序列:
# 在有些时候我们需要对编辑器中我们不可见的一些类似于换行符之类的符号做操作时,就需要用到非打印字符了
字符 | 描述 |
---|---|
\s | 匹配任何空白字符,包括空格、制表符、换页符等等。等价于 [ \f\n\r\t\v]。注意 Unicode 正则表达式会匹配全角空格符。 |
\S | 匹配任何非空白字符。等价于 [^ \f\n\r\t\v] 或 [^ \s]。 |
\n | 匹配一个换行符。等价于 \x0a 和 \cJ。 |
\r | 匹配一个回车符。等价于 \x0d 和 \cM。 |
\f | 匹配一个换页符。等价于 \x0c 和 \cL。 |
\t | 匹配一个制表符。等价于 \x09 和 \cI。 |
\v | 匹配一个垂直制表符。等价于 \x0b 和 \cK。 |
\cx | 匹配由x指明的控制字符。例如, \cM 匹配一个 Control-M 或回车符。x 的值必须为 A-Z 或 a-z 之一。否则,将 c 视为一个原义的 'c' 字符。 |
特殊字符
许多元字符要求在试图匹配它们时特别对待。若要匹配这些特殊字符,必须首先使字符"转义",即,将反斜杠字符\ 放在它们前面。下表列出了正则表达式中的特殊字符:
特别字符 | 描述 |
---|---|
^ | 匹配输入字符串的开始位置,除非在方括号表达式中使用,此时它表示不接受该字符集合。要匹配 ^ 字符本身,请使用 \^。^xxx相当于“以xxx开始” [^ xxx] 则表示 “不是xxx” |
$ | 匹配输入字符串的结尾位置。如果设置了 RegExp 对象的 Multiline 属性,则 $ 也匹配 '\n' 或 '\r'。要匹配 $ 字符本身,请使用 \$。 相当于“以xxx结尾” |
\b | 匹配一个单词边界,即字与空格间的位置。相当于以xxx(开始?结束)的单词 |
\B | 非单词边界匹配。 相当于不是单词(开始?结束)位置的xxx |
\d | 匹配一个数字字符。等价于 [0-9]。 |
\D | 匹配一个非数字字符。等价于 [^0-9]。 |
\w | 匹配字母、数字、下划线。等价于'[A-Za-z0-9_]'。 |
\W | 匹配非字母、数字、下划线。等价于 '[^A-Za-z0-9_]'。 |
\num | 匹配 num,其中 num 是一个正整数。对所获取的匹配的引用。例如,'(.)\1' 匹配两个连续的相同字符。 |
( ) | 标记一个子表达式的开始和结束位置。子表达式可以获取供以后使用。要匹配这些字符,请使用 ( 和 )。相当于一个子匹配 |
. | 匹配除换行符 \n 之外的任何单字符。要匹配 . ,请使用 \. 。 |
[ | 标记一个中括号表达式的开始。要匹配 [,请使用 \ [ 。 |
\ | 将下一个字符标记为或特殊字符、或原义字符、或向后引用、或八进制转义符。例如, 'n' 匹配字符 'n'。\n 匹配换行符。序列 \\ 匹配 \,而 \( 则匹配 ( 。 |
丨 | 指明两项之间的一个选择。要匹配 丨,请使用 \丨 。相当于OR |
{ | 标记限定符表达式的开始。要匹配 {,请使用 \ { 。 |
* | 匹配前面的子表达式零次或多次。要匹配 * 字符,请使用 \* 。 |
+ | 匹配前面的子表达式一次或多次。要匹配 + 字符,请使用 \+ 。 |
? | 匹配前面的子表达式零次或一次,或指明一个非贪婪限定符。要匹配 ? 字符,请使用 \? 。 |
断言
表示一个匹配在某些条件下发生。断言包含先行断言、后行断言和条件表达式。 ( ) 内的参数只参与判断 不作为结果 )
字符 | 描述 |
---|---|
x(?=y) | 正向肯定断言 Lookahead assertion: Matches x only if x is followed by y. For example, /Jack(?=Sprat)/ matches "Jack" only if it is followed by "Sprat". /Jack(?=Sprat丨Frost)/ matches "Jack" only if it is followed by "Sprat" or "Frost". However, neither "Sprat" nor "Frost" is part of the match results. 一个被y紧跟着的x |
x(?!y) | Negative lookahead assertion: Matches x only if x is not followed by y. For example, /\d+(?!.)/ matches a number only if it is not followed by a decimal point. /\d+(?!.)/.exec('3.141') matches "141" but not "3. 一个不被y跟着的x |
(?<=y)x | Lookbehind assertion: Matches x only if x is preceded by y. For example, /(?<=Jack)Sprat/ matches "Sprat" only if it is preceded by "Jack". /(?<=Jack丨Tom)Sprat/ matches "Sprat" only if it is preceded by "Jack" or "Tom". However, neither "Jack" nor "Tom" is part of the match results. 一个紧跟着y的x |
(?<!y)x | Negative lookbehind assertion: Matches x only if x is not preceded by y. For example, /(?<!-)\d+/ matches a number only if it is not preceded by a minus sign. /(?<!-)\d+/.exec('3') matches "3". /(?<!-)\d+/.exec('-3') match is not found because the number is preceded by the minus sign. 一个不紧跟着y的x |
限定符
限定符用来指定正则表达式的一个给定组件必须要出现多少次才能满足匹配。有 * 或 + 或 ? 或 {n} 或 {n,} 或 {n,m} 共6种。
# 限定符的概念可以当做Loop 循环的概念来理解 ⊙为条件
其中 * 相当于 while ⊙, + 相当于 do while ⊙, ? 相当于 switch ⊙ break;
{n} 相当于 if ( ⊙⊙⊙(n个⊙) ),
{n,} 相当于 if( ⊙⊙ || ⊙⊙⊙ || ⊙⊙⊙⊙ || ⊙⊙⊙⊙⊙(n个⊙)... )
{n,m} 相当于 if( ⊙⊙(n个⊙) || ⊙⊙⊙ || .... ⊙⊙⊙⊙(m个⊙) )
* 等同于 {0,}
+ 等同于 {1,}
? 等同于 {0,1}
# 限定符生效的是前面的子表达式,例如 ()* , []*, abc*
正则表达式的限定符有:
字符 | 描述 |
---|---|
* | 匹配前面的子表达式零次或多次。例如,zo 能匹配 "z" 以及 "zoo"。 等价于{0,}。 |
+ | 匹配前面的子表达式一次或多次。例如,'zo+' 能匹配 "zo" 以及 "zoo",但不能匹配 "z"。+ 等价于 {1,}。 |
? | 匹配前面的子表达式零次或一次。例如,"do(es)?" 可以匹配 "do" 、 "does" 中的 "does" 、 "doxy" 中的 "do" 。? 等价于 {0,1}。 |
{n} | n 是一个非负整数。匹配确定的 n 次。例如,'o{2}' 不能匹配 "Bob" 中的 'o',但是能匹配 "food" 中的两个 o。 |
{n,} | n 是一个非负整数。至少匹配n 次。例如,'o{2,}' 不能匹配 "Bob" 中的 'o',但能匹配 "foooood" 中的所有 o。'o{1,}' 等价于 'o+'。'o{0,}' 则等价于 'o*'。 |
{n,m} | m 和 n 均为非负整数,其中n <= m。最少匹配 n 次且最多匹配 m 次。例如,"o{1,3}" 将匹配 "fooooood" 中的前三个 o。'o{0,1}' 等价于 'o?'。请注意在逗号和两个数之间不能有空格。 |
贪婪、非贪婪 默认情况下, * + 都是贪婪匹配 譬如说:
<p>Hello!</p>
使用 /<.*>/ 就可以匹配到整句, 其中 . 会包含除了最后一个> 以外的全部字符
如果使用非贪婪 /<.*?>/ 就只会匹配到 <p>, 这里匹配到第一个>时,就会认为已经触发结束条件了。
整理一下如果转换成语义化编程的方式 ( 由于我个人记性不行,所以打算后面写个语义化生成正则的小函数 )
# PHP语法 ( 也可以扩展到JS中 用JSON方式递归生成 )
'^' : beginWith( string $c ) # 以什么开始
'$' : endWith( string $c ) # 以什么结束
'*,+,{}' : loop( int $n, int $m ) # 循环某个子集或字符 n-m次
'?' : isGreedy( boolean $b ) # 是否贪婪执行
'()' : subPreg( array $p ) # 子集 ( 记录到$1...$9 )
'(?:)' : subPreg( array $p, boolean $remberToSubObj ) # 子集 不记录
'[]' : anyOf( array|string $a ) # 任一子集
'[n-m]': anyOfRange( any $n, any $m ) # 从n-m的任一子集
'|' : || # 或
'.' : 'NOT_BREAK' # 除换行外 任意字符
'\s' : 'EMPTY' # 任意空字符
'\S' : 'NOT_EMPTY' # 任意非空字符
'\n' : 'BREAK' # 换行符
'\r' : 'ENTER' # 回车
'[^ ]': isNot( any $c ) # 除此之外的匹配
// 由于方法都返回正则片段 所以方法也可以是正则的值,采用递归向上合并的方式即可组合复杂表达式
# /<.*>/ 如果要写一个正则的话,使用数组的形式来写
$simplePreg = [
[ 'beginWith' => '<' ],
[ 'loop' => [ 'NOT_BREAK' , 0, NULL ] ],
[ 'endWith' => '>' ]
];
# 复杂一点 写一个 有class属性的 div 的正则
$advPreg = [
[ 'beginWith' => '<div' ],
[ 'loop' => [ 'NOT_BREAK' , 1, NULL ] ],
'class=',
[ 'loop' => [ 'NOT_BREAK' , 0, NULL ] ],
[ 'endWith' => '<\/div>' ]
];
# 生成结果: /^<div.*class=.*<\/div>/
文章地址: 正则表达式的梳理和练习笔记 - Sprite keep learning
最近回复