版权声明
1. 本站文章和资源均来自互联网收集和整理,本站不承担任何责任及版权问题。
2. 相关版权归作者及其公司所有,仅供学习研究用途,请勿用于商业目的。
3. 若侵犯您的版权,请发邮件至webmaster@ishare1.cn联系我们,我们确认后将立即删除。

由于编辑人员从excel,word等乱七八糟的地方copy内容过来,其中有不可见的字符,导致输出内容看上去是对的,其实是多了一个零长度的字符(比如:u2028,0000200B ZERO WIDTH SPACE),所以需要过滤掉不合法的unicode编码等特殊字符
整理的正则:
[u007f-u009f]|u00ad|[u0483-u0489]|[u0559-u055a]|u058a|[u0591-u05bd]|u05bf|[u05c1-u05c2]|[u05c4-u05c7]|[u0606-u060a]|[u063b-u063f]|u0674|[u06e5-u06e6]|u070f|[u076e-u077f]|u0a51|u0a75|u0b44|[u0b62-u0b63]|[u0c62-u0c63]|[u0ce2-u0ce3]|[u0d62-u0d63]|u135f|[u200b-u200f]|[u2028-u202e]|u2044|u2071|[uf701-uf70e]|[uf710-uf71a]|ufb1e|[ufc5e-ufc62]|ufeff|ufffc
java代码如下:
private String replaceWrongUnicode(String source, String replace) {
if (StringUtils.isBlank(source)) {
return source;
}
if (StringUtils.isBlank(replace)) {
replace = "";
}
Pattern CRLF = Pattern.compile("([u007f-u009f]|u00ad|[u0483-u0489]|[u0559-u055a]|u058a|[u0591-u05bd]|u05bf|[u05c1-u05c2]|[u05c4-u05c7]|[u0606-u060a]|[u063b-u063f]|u0674|[u06e5-u06e6]|u070f|[u076e-u077f]|u0a51|u0a75|u0b44|[u0b62-u0b63]|[u0c62-u0c63]|[u0ce2-u0ce3]|[u0d62-u0d63]|u135f|[u200b-u200f]|[u2028-u202e]|u2044|u2071|[uf701-uf70e]|[uf710-uf71a]|ufb1e|[ufc5e-ufc62]|ufeff|ufffc)");
Matcher m = CRLF.matcher(source);
if (m.find()) {
return m.replaceAll(replace);
}
return source;
}
附:过滤
成
private String replaceEnter(String source) {
if (StringUtils.isBlank(source)) {
return source;
}
Pattern CRLF = Pattern.compile("(
|
|
|
)");
Matcher m = CRLF.matcher(source);
if (m.find()) {
return m.replaceAll("
");
}
return source;
}
更多java知识请关注java基础教程栏目。
爱分享




