中文字符匹配js正则表达式

普遍使用的正则是[u4e00-u9fa5]，但这个范围并不完整。例如：

/[u4e00-u9fa5]/.test( '⻏' ) // 测试部首⻏，返回false

根据Unicode 5.0版编码，要准确的判断一个中文字符要包括：

范围含义范围含义

2E80-2EFF CJK 部首补充 2F00-2FDF 康熙字典部首

3000-303F CJK 符号和标点 31C0-31EF CJK 笔画

3200-32FF 封闭式 CJK 文字和月份 3300-33FF CJK 兼容

3400-4DBF CJK 统一表意符号扩展 A 4DC0-4DFF 易经六十四卦符号

4E00-9FBF CJK 统一表意符号 F900-FAFF CJK 兼容象形文字

FE30-FE4F CJK 兼容形式 FF00-FFEF 全角ASCII、全角标点

因此，正确的匹配中文字符正则表达式为：

var rcjk = /[u2E80-u2EFFu2F00-u2FDFu3000-u303Fu31C0-u31EFu3200-u32FFu3300-u33FFu3400-u4DBFu4DC0-u4DFFu4E00-u9FBFuF900-uFAFFuFE30-uFE4FuFF00-uFFEF]+/g;

如果不希望匹配标点、符号，在正则中去掉对应的范围即可：

3000-303F CJK 符号和标点 FF00-FFEF 全角ASCII、全角标点

或者charCodeAt()>255

原帖地址：http://my.oschina.net/u/1182602/blog/406435