查看: 563|回复: 23

[应用] Emeditor 常用的正则表达式

[复制链接]
惘城落遇 发表于 2018-8-24 16:32:29 | 显示全部楼层 |阅读模式
Emeditor 目前来说是我个人感觉非常不错的一款记事本软件, 其中查找替换功能由于支持正则表达式而显得非常强大.

^[  /t]*/n
这个正则表达式代表所有的空行,指含有零个或零个以上空格或制表符、以换行符结尾、不含其它字符的行。

(^|(?<=中国)).*?(?=中国|$)
用正则表达式匹配特定字符串外的所有字符。指除“中国”外的所有其它字符,类似于反选功能。

^[  /t]+
查找以上字符,并替换为空,可删除行首空白(包括全半角空格和制表符)。

[  /t]+$
查找以上字符,并替换为空,可删除行末空白(包括全半角空格和制表符)。

^[  /t]+|[  /t]+$
查找以上正则表达式,并替换为空,可删除行首和行末所有空白(包括全半角空格和制表符)。

匹配中文字符的正则表达式: [/u4e00-/u9fa5]
评注:匹配中文还真是个头疼的事,有了这个表达式就好办了

匹配双字节字符(包括汉字在内):[^/x00-/xff]
评注:可以用来计算字符串的长度(一个双字节字符长度计2,ASCII字符计1)

匹配空白行的正则表达式:/n/s*/r
评注:可以用来删除空白行

匹配HTML标记的正则表达式:< (/S*?)[^>]*>.*?|< .*? />
评注:网上流传的版本太糟糕,上面这个也仅仅能匹配部分,对于复杂的嵌套标记依旧无能为力

匹配首尾空白字符的正则表达式:^/s*|/s*$
评注:可以用来删除行首行尾的空白字符(包括空格、制表符、换页符等等),非常有用的表达式

匹配Email地址的正则表达式:/w+([-+.]/w+)*@/w+([-.]/w+)*/./w+([-.]/w+)*
评注:表单验证时很实用

匹配网址URL的正则表达式:[a-zA-z]+://[^/s]*
评注:网上流传的版本功能很有限,上面这个基本可以满足需求

匹配帐号是否合法(字母开头,允许5-16字节,允许字母数字下划线):^[a-zA-Z][a-zA-Z0-9_]{4,15}$
评注:表单验证时很实用

匹配国内电话号码:/d{3}-/d{8}|/d{4}-/d{7}
评注:匹配形式如 0511-4405222 或 021-87888822

匹配腾讯QQ号:[1-9][0-9]{4,}
评注:腾讯QQ号从10000开始

匹配中国邮政编码:[1-9]/d{5}(?!/d)
评注:中国邮政编码为6位数字

匹配身份证:/d{15}|/d{18}
评注:中国的身份证为15位或18位

匹配ip地址:/d+/./d+/./d+/./d+
评注:提取ip地址时有用

匹配特定数字:
^[1-9]/d*$    //匹配正整数
^-[1-9]/d*$   //匹配负整数
^-?[1-9]/d*$   //匹配整数
^[1-9]/d*|0$  //匹配非负整数(正整数 + 0)
^-[1-9]/d*|0$   //匹配非正整数(负整数 + 0)
^[1-9]/d*/./d*|0/./d*[1-9]/d*$   //匹配正浮点数
^-([1-9]/d*/./d*|0/./d*[1-9]/d*)$  //匹配负浮点数
^-?([1-9]/d*/./d*|0/./d*[1-9]/d*|0?/.0+|0)$  //匹配浮点数
^[1-9]/d*/./d*|0/./d*[1-9]/d*|0?/.0+|0$   //匹配非负浮点数(正浮点数 + 0)
^(-([1-9]/d*/./d*|0/./d*[1-9]/d*))|0?/.0+|0$  //匹配非正浮点数(负浮点数 + 0)
评注:处理大量数据时有用,具体应用时注意修正

匹配特定字符串:
^[A-Za-z]+$  //匹配由26个英文字母组成的字符串
^[A-Z]+$  //匹配由26个英文字母的大写组成的字符串
^[a-z]+$  //匹配由26个英文字母的小写组成的字符串
^[A-Za-z0-9]+$  //匹配由数字和26个英文字母组成的字符串
^/w+$  //匹配由数字、26个英文字母或者下划线组成的字符串
评注:最基本也是最常用的一些表达式

^.*John.*$
匹配包括“John”的整行。
 楼主| 惘城落遇 发表于 2018-8-24 16:41:32 | 显示全部楼层
1 查找<>之间的字符串:   ".*?"
2 查找双引号之间的字符串:   ".*?"
3 [ ]包含的字符串                                                  \[[^\[]*?\]
4 变量名                                                            [a-zA-Z_][a-zA-Z_0-9]*
5 IP 地址                                   ([0-9]{1,3})\.([0-9]{1,3})\.([0-9]{1,3})\.([0-9]{1,3})
6 各行Tab以后的文字列                                                \t.*$
7 行头插入 //                                                     Find: ^   Replace with: //
8 删除行头 //                                                     Find: ^//
9 删除行后的空白文字(包含空格和制表位 Space+Tab)                Find: \s+?$
10 将(abc)替换为[abc]                                              Find: \((.*?)\) Replace: \[\1\]
11 将<H3 …>替换为<H4 …>                                          Find: <H3(.*?)> Replace: <H4\1>
12 将9/13/2003替换为2003年9月13日 Find: ([0-9]{1,2})/([0-9]{1,2})/([0-9]{2,4}) Replace: \3年\1月\2日
13 将字母a-z替换为大写字母                                         Find: [a-z]      Replace: \U\0
14 首字母大写                                       Find: ([a-zA-Z])([a-zA-Z]*)    Replace: \U\1\L\2
15 平仮名ひらがなHiragana                                         [\x{3041}-\x{309e}]
16 全角片仮名 全角カタカナFull-width Katakana                   [\x{309b}-\x{309c}\x{30a1}-\x{30fe}]
17 半角仮名 半角カナHalf-width Kana                                [\x{ff61}-\x{ff9f}]
 楼主| 惘城落遇 发表于 2018-8-24 16:48:24 | 显示全部楼层

表达式 说明
[] 匹配列表之中的任何单个字符. 例如, "[ab]" 匹配 "a" 或者 "b". "[0-9]" 匹配任意数字.
[^] 匹配列表之外的任何单个字符. 例如, "[^ab]" 匹配 "a" 和 "b" 以外的字符. "[^0-9]" 匹配任意非数字字符.

[abxy0-6] 匹配abxy中任意一个字母或0-6任意一个数字
[^abxy0-6] 匹配除了abxy和0-6的任意一个字符

^ 其右边的表达式被匹配在一行的开始. 例如 "^A" 仅仅匹配以 "A" 开头的行.
() 影响表达式匹配的顺序,并且用作表达式的分组标记.
\ 转义字符. 如果你要使用 "" 本身, 则应该使用 "\".



. 匹配任意一个字符
\t 匹配tab
\n new line
\r return

\w word, 匹配任意一个字母(加上"_")
\W 匹配任意一个非字母
\s space, 匹配空格
\S 匹配非空格
\d digital,匹配任意一个数字
\D 匹配任意一个非数字

{n,m} 匹配n到m次
? 匹配0或1次,相当于 {0,1}其左边的字符被匹配0次或者1次. 例如 "be?" 匹配 "b" 或者 "be" 但是不匹配 "bee".
* 匹配0或多次,相当于 {0,}其左边的字符被匹配任意次(0次,或者多次). 例如 "be*" 匹配 "b", "be" 或者 "bee".
+ 匹配1或多次,相当于 {1,}其左边的字符被匹配至少一次(1次,或者多次). 例如 "be+" 匹配 "be" 或者 "bee" 但是不匹配 "b".


^ 匹配行首
$ 匹配行尾
\b boundary,匹配单词边界

| or
( ) 括号分组,用于后向引用
\1 \2 后向引用先前括号分组的表达式
\0 将引用上次的匹配结果


例子:

原始串
str[1]abc[991];
str[2]abc[992];
str[11]abc[993];
str[22]abc[994];
str[111]abc[995];
str[222]abc[996];
str[1111]abc[997];
str[2222]abc[999];

目标串:
abc[1];
abc[2];
abc[11];
abc[22];
abc[111];
abc[222];
abc[1111];
abc[2222];

处理:
查找串:str\[([0-9]+)\]abc\[[0-9]+\]
替换串:abc[\1]

【1】正则表达式应用——替换指定内容到行尾
原始文本如下面两行
abc aaaaa
123 abc 444

希望每次遇到“abc”,则替换“abc”以及其后到行尾的内容为“abc efg”
即上面的文本最终替换为:
abc efg
123 abc efg

解决:
① 在替换对话框,查找内容里输入“abc.*”
② 同时勾选“正则表达式”复选框,然后点击“全部替换”按钮
其中,符号的含义如下:
“.” =匹配任意字符
“*” =匹配0次或更多

注意:其实就是正则表达式替换,这里只是把一些曾经提出的问题加以整理,单纯从正则表达式本身来说,就可以引申出成千上万种特例。

【2】正则表达式应用——数字替换
希望把
asdadas123asdasdas456asdasdasd789asdasd
替换为:
asdadas[123]asdasdas[456]asdasdasd[789]asdasd

在替换对话框里面,勾选“正则表达式”复选框;
在查找内容里面输入“[0-9][0-9][0-9]”,不含引号
“替换为:”里面输入“[\0\1\2]”,不含引号
范围为你所操作的范围,然后选择替换即可。

实际上这也是正则表达式的使用特例,“[0-9]”表示匹配0~9之间的任何特例,同样“[a-z]”就表示匹配a~z之间的任何特例
上面重复使用了“[0-9]”,表示连续出现的三个数字
“\0”代表第一个“[0-9]”对应的原型,“\1”代表第二个“[0-9]”对应的原型,依此类推
“[”、“]”为单纯的字符,表示添加“[”或“]”,如果输入“其它\0\1\2其它”,则替换结果为:

asdadas其它123其它asdasdas其它456其它asdasdasd其它789其它asdasd

功能增强(by jiuk2k):
如果将查找内容“[0-9][0-9][0-9]”改为“[0-9]*[0-9]”,对应1 或 123 或 12345 或 …
大家根据需要定制

相关内容还有很多,可以自己参考正则表达式的语法仔细研究一下

【3】正则表达式应用——删除每一行行尾的指定字符
因为这几个字符在行中也是出现的,所以肯定不能用简单的替换实现
比如
12345 1265345
2345
需要删除每行末尾的“345”
这个也算正则表达式的用法,其实仔细看正则表达式应该比较简单,不过既然有这个问题提出,说明对正则表达式还得有个认识过程,解决方法如下
解决:
在替换对话框中,启用“正则表达式”复选框
在查找内容里面输入“345$”
这里“$”表示从行尾匹配

如果从行首匹配,可以用“^”来实现,不过 EditPlus 有另一个功能可以很简单的删除行首的字符串
a. 选择要操作的行
b. 编辑-格式-删除行注释
c. 在弹出对话框里面输入要清除的行首字符,确定

【4】正则表达式应用——替换带有半角括号的多行
几百个网页中都有下面一段代码:
\n
在替换对话框启用“正则表达式”选项,这时就可以完成替换了

 楼主| 惘城落遇 发表于 2018-8-24 16:48:51 | 显示全部楼层
【5】正则表达式应用——删除空行
启动EditPlus,打开待处理的文本类型文件。
①、选择“查找”菜单的“替换”命令,弹出文本替换对话框。选中“正则表达式”复选框,表明我们要在查找、替换中使用正则表达式。然后,选中“替换范围”中的“当前文件”,表明对当前文件操作。
②、单击“查找内容”组合框右侧的按钮,出现下拉菜单。
③、下面的操作添加正则表达式,该表达式代表待查找的空行。(技巧提示:空行仅包括空格符、制表符、回车符,且必须以这三个符号之一作为一行的开头,并且以回车符结尾,查找空行的关键是构造代表空行的正则表达式)。
直接在”查找”中输入正则表达式“^[ \t]*\n”,注意\t前有空格符。
(1)选择“从行首开始匹配”,“查找内容”组合框中出现字符“^”,表示待查找字符串必须出现在文本中一行的行首。
(2)选择“字符在范围中”,那么在“^”后会增加一对括号“[]”,当前插入点在括号中。括号在正则表达式中表示,文本中的字符匹配括号中任意一个字符即符合查找条件。
(3)按一下空格键,添加空格符。空格符是空行的一个组成成分。
(4)选择“制表符”,添加代表制表符的“\t”。
(5)移动光标,将当前插入点移到“]”之后,然后选择“匹配 0 次或更多”,该操作会添加星号字符“*”。星号表示,其前面的括号“[]”内的空格符或制表符,在一行中出现0个或多个。
(6)选择“换行符”,插入“\n”,表示回车符。
④、“替换为”组合框保持空,表示删除查找到的内容。单击“替换”按钮逐个行删除空行,或单击“全部替换”按钮删除全部空行(注意:EditPlus有时存在“全部替换”不能一次性完全删除空行的问题,可能是程序BUG,需要多按几次按钮)。


更多示例:
1.在汉化的时候,是否经常碰到这样的语句需要翻译:

Code:
“Error adding the post!”;
“Error adding the comment!”;
“Error adding the user!”;

如果有很多类似的文件一个一个翻译显然很累而且感觉很无聊。

其实可以这样处理,在Editplus里面用 替换 功能,在替换对话框选中“正则表达式”复选框:
查找原文件:

Code:
“Error adding ([^!|"|;]*)

替换成:

Code:
“在增加\1时发生错误

这样替换之后发生了什么?结果是:

Code:
“在增加the post时发生错误!”;
“在增加the comment时发生错误!”;
“在增加the user时发生错误!”;

ok,接下来你会怎么做?当然再替换一次把the post、the comment、the user替换成你要翻译的词。得到最后的结果:

Code:
“在增加帖子时发生错误!”;
“在增加评论时发生错误!”;
“在增加用户时发生错误!”;

2.要提取的单词在中间,比如:

Code:
can not be deleted because
can not be added because
can not be updating because

可以用这种方式:
在Editplus里面用 替换 功能,在替换对话框选中“正则表达式”复选框:
查找原文件:

Code:
can not be ([^ ]*) because

替换成:

Code:
无法被\1因为

这样替换之后发生了什么?结果是:

Code:
无法被deleted因为
无法被added因为
无法被updating因为

其余步骤如上。

在汉化量很大而且句式比较单调的情况下对效率的提高很明显!

解释一下:([^!|"|;]*) 的意思是 不等于 ! 和 ” 和 ; 中的任何一个,意思就是这3个字符之外的所有字符将被选中(替换区域);
\1 即被选中的替换区域所在的新位置(复制到这个新位置)。

3.删除文本文件里面的空白行

查找原文件:
Code:
^[ \t]*\n

高级替换:
abandon[2’b9nd2n]v.抛弃,放弃
abandonment[2’b9nd2nm2nt]n.放弃
abbreviation[2bri:vi’ei62n]n.缩写
abeyance[2’bei2ns]n.缓办,中止
abide[2’baid]v.遵守
ability[2’biliti]n.能力
able[’eibl]adj.有能力的,能干的
abnormal[9b’n0:m2l]adj.反常的,变态的
aboard[2’b0:d]adv.船(车)上

1.
查找: (^[a-zA-Z0-0\-]+)(\[*.*\]+)(.*)
替换: @@@@@”\1″,”\2″,”\3″,
效果:
@@@@@”abandon”,”[2’b9nd2n]“,”v.抛弃,放弃”,
@@@@@”abandonment”,”[2’b9nd2nm2nt]“,”n.放弃”,
@@@@@”abbreviation”,”[2bri:vi’ei62n]“,”n.缩写”,
@@@@@”abeyance”,”[2’bei2ns]“,”n.缓办,中止”,
@@@@@”abide”,”[2’baid]“,”v.遵守”,
@@@@@”ability”,”[2’biliti]“,”n.能力”,
@@@@@”able”,”[’eibl]“,”adj.有能力的,能干的”,
@@@@@”abnormal”,”[9b’n0:m2l]“,”adj.反常的,变态的”,
@@@@@”aboard”,”[2’b0:d]“,”adv.船(车)上”,

2.
查找: \n
替换:
注: 要次替换内容为空
效果:
@@@@@”abandon”,”[2’b9nd2n]“,”v.抛弃,放弃 ”,@@@@@”abandonment”,”[2’b9nd2nm2nt]“,”n.放弃 ”,@@@@@”abbreviation”,”[2bri:vi’ei62n]“,”n.缩写 ”,@@@@@”abeyance”,”[2’bei2ns]“,”n.缓办,中止”,@@@@@”abide”,”[2’baid]“,”v.遵守 ”,@@@@@”ability”,”[2’biliti]“,”n.能力”,@@@@@”able”,”[’eibl]“,”adj.有能力的,能干的 ”,@@@@@”abnormal”,”[9b’n0:m2l]“,”adj.反常的,变态的 ”,@@@@@”aboard”,”[2’b0:d]“,”adv.船(车)上”,@@@@@”abolish”,”[2’b0li6]“,”v.废除,取消”,@@@@@”abolition”,”[9b2’li62n]“,”n.废除,取消”

3.
查找: @@@@@
替换: \n
效果:
“abandon”,”[2’b9nd2n]“,”v.抛弃,放弃”,
“abandonment”,”[2’b9nd2nm2nt]“,”n.放弃”,
“abbreviation”,”[2bri:vi’ei62n]“,”n.缩写”,
“abeyance”,”[2’bei2ns]“,”n.缓办,中止”,
“abide”,”[2’baid]“,”v.遵守”,
“ability”,”[2’biliti]“,”n.能力”,
“able”,”[’eibl]“,”adj.有能力的,能干的”,
“abnormal”,”[9b’n0:m2l]“,”adj.反常的,变态的”,
“aboard”,”[2’b0:d]“,”adv.船(车)上”,
“abolish”,”[2’b0li6]“,”v.废除,取消”,





4.
双引号包含的字符串                                               “.*?”
[ ]包含的字符串                                                  \[[^\[]*?\]
变量名                                                            [a-zA-Z_][a-zA-Z_0-9]*
IP 地址                                   ([0-9]{1,3})\.([0-9]{1,3})\.([0-9]{1,3})\.([0-9]{1,3})
各行Tab以后的文字列                                                \t.*$
行头插入 //                                                     Find: ^   Replace with: //
删除行头 //                                                     Find: ^//

删除行后的空白文字(包含空格和制表位 Space+Tab)                Find: \s+?$
将(abc)替换为[abc]                                              Find: \((.*?)\) Replace: \[\1\]
将<H3 …>替换为<H4 …>                                          Find: <H3(.*?)> Replace: <H4\1>
将9/13/2003替换为2003年9月13日 Find: ([0-9]{1,2})/([0-9]{1,2})/([0-9]{2,4}) Replace: \3年\1月\2日
将字母a-z替换为大写字母                                         Find: [a-z]      Replace: \U\0
首字母大写                                       Find: ([a-zA-Z])([a-zA-Z]*)    Replace: \U\1\L\2
平仮名ひらがなHiragana                                         [\x{3041}-\x{309e}]
全角片仮名 全角カタカナFull-width Katakana                   [\x{309b}-\x{309c}\x{30a1}-\x{30fe}]
半角仮名 半角カナHalf-width Kana                                [\x{ff61}-\x{ff9f}]
中日韩 汉字CJK ideographs                                    [\x{3400}-\x{9fff}\x{f900}-\x{fa2d}]
中日韩 汉字符号CJK ideograph marks                              [\x{3000}-\x{3037}]
韩国字符Hangul                              [\x{1100}-\x{11f9}\x{3131}-\x{318e}\x{ac00}-\x{d7a3}]

 楼主| 惘城落遇 发表于 2018-8-27 08:14:46 | 显示全部楼层
>chr14:22449113:22449125
>chr14:22438547:22438554
>chr7:142847306:142847317
这几行的格式统一改成:>chr15:20004797-20004815


  1. 查找:
  2. (>chr\d+:\d+):(\d+)
  3. 替换:
  4. $1-$2
复制代码
 楼主| 惘城落遇 发表于 2018-8-27 08:17:36 | 显示全部楼层
删除&开头,;结尾的所有字符串

正则为 ^&.*?;$ 或者 试试 &.*?;
替换为空字符串
 楼主| 惘城落遇 发表于 2018-8-27 08:20:25 | 显示全部楼层
woainibeibei----woai9873
4343434i----98745A11
以上2个案例,我想替换----后面少于8个字符的内容为我指定内容
woainibeibei----woai987    替换后为woainibeibei

查找:
----.{1,7}$
替换为:
(空)

$表示行末。
 楼主| 惘城落遇 发表于 2018-8-27 08:21:11 | 显示全部楼层
把不包含“#”这个符号的行删除

^[^#]+$
如果要同时删除换行符:
^[^#]+\n
如果要同时删除空行:
^[^#]*\n
 楼主| 惘城落遇 发表于 2018-8-27 08:26:38 | 显示全部楼层
删除\之前的字符,只想保留人名那部分

001.荷马史诗\荷马
002.伊索寓言\伊索
003.俄狄浦斯王\索福克勒斯
004.莎士比亚全集\莎士比亚
005.论人生\培根


用正则表达式查找:
^.+\\
替换为空
正则表达式的解释:
^表示:行首
.表示:任意字符
.+表示:1个以上的任意字符
\\表示:\
^.+\\表示:从行首到\的最大匹配(即:如果一行有多个\,则取到每行的最后一个\)
如果要最小匹配(只取到第一个\),就用:
^.+?\'
 楼主| 惘城落遇 发表于 2018-8-27 08:30:17 | 显示全部楼层
查找并替换重复自然段

查找(.+)\n\1替换\1
*滑动验证:
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|Archiver|手机版|小黑屋|上水君玉 ( 沪ICP备15023852号-1 )

GMT+8, 2018-12-19 20:33 , Processed in 0.089344 second(s), 23 queries .

Powered by Discuz! X3.4

© 2001-2017 Comsenz Inc.

快速回复 返回顶部 返回列表