用perl将全角标点数字改为半角
发布时间:2020-12-16 00:02:40 所属栏目:大数据 来源:网络整理
导读:在GB2312下的全角标点和ascii码下的半角标是有联系的。不要什么对照表,全角字符是两 个字节,跟半角字符有一一对应的线性关系,? 很简单.? 第一字节: 160+区号 { 全角的第一字节相等 }? 第二字节: 128+半角ascii码? 因此,将全角标点转换为半角标点可用以下语
在GB2312下的全角标点和ascii码下的半角标是有联系的。不要什么对照表,全角字符是两
个字节,跟半角字符有一一对应的线性关系,? 很简单.? 第一字节: 160+区号 { 全角的第一字节相等 }? 第二字节: 128+半角ascii码? 因此,将全角标点转换为半角标点可用以下语句完成 $str=~s/(xA3(.))/chr(ord($2)-128)/eg; [1] $str =~ s/x{A3}(.)/chr(ord($1)-128)/eg; [2] (应用此语句会发成xA3的匹配冲突。这也是gb2312下进行汉字匹配时最头疼的事情。) 因此,对应一些特定的符号,我们可以使用下面这条语句进行处理(依旧会有冲突如“危机”一词) $str=~s/(0|1|2|3|4|5|6|7|8|9| A|B|C|D|E|F|G|H|I|J|K|L|M|N|O|P|Q|R|S|T|U|V|W|X|Y|Z| a|b|c|d|e|f|g|h|i|j|k|l|m|n|o|p|q|r|s|t|u|v|w|x|y|z| |%(|)|+|-|.|/|:|,|;|?|!|{|}||)/chr(ord(substr($1,1,1))-128)/xeg; 这里多少还是用到了穷举的思想,但是起码比一行一行穷举方便多了。 还有一种方法是借助了哈希表的思想 将要替换的字符存入哈希表,然后比照哈希表进行替换。如下: my %h = ("0"=>" ]","1"=>"1","2"=>"2","3"=>"3","4"=>"4","5"=>"5","6"=>"6","7"=>"7","8"=>"8", "9"=>"9","%"=>"%","("=>"(",")"=>")","+"=>"+","-"=>"-","."=>".","/"=>"/",":"=>":", ","=>",",";"=>";","?"=>"?","!"=>"!","{"=>"{","}"=>"}","|"=>"|","。"=>"."); $str="杜斯特-布拉齐说,法国外交部已成立危机小组以处理善后事宜。"; my $newstr = ""; $str=~s/([x80-xff]{2})/$h{ $1 } ? $h{ $1 } : $1/eg; $str=~s/[0]/0/g; #简单的替换0会在$h{$1} ? $h{$1}:$1时将$h{$1}(=0)判断为错 print $str; 相信这么做的效率应该比方法一要低不少。而且还需要额外的空间来存储哈希表。但是这样做不会产生ascii下的匹配错误,是安全的。 (编辑:李大同) 【声明】本站内容均来自网络,其相关言论仅代表作者个人观点,不代表本站立场。若无意侵犯到您的权利,请及时与联系站长删除相关内容! |