版权声明
1. 本站文章和资源均来自互联网收集和整理,本站不承担任何责任及版权问题。
2. 相关版权归作者及其公司所有,仅供学习研究用途,请勿用于商业目的。
3. 请于下载后24小时内删除,如果喜欢此资源,请购买正版。
4. 若侵犯您的版权,请发邮件至webmaster@ishare1.cn联系我们,我们确认后将立即删除。
由于编辑人员从excel,word等乱七八糟的地方copy内容过来,其中有不可见的字符,导致输出内容看上去是对的,其实是多了一个零长度的字符(比如:u2028,0000200B ZERO WIDTH SPACE),所以需要过滤掉不合法的unicode编码等特殊字符
整理的正则:
[u007f-u009f]|u00ad|[u0483-u0489]|[u0559-u055a]|u058a|[u0591-u05bd]|u05bf|[u05c1-u05c2]|[u05c4-u05c7]|[u0606-u060a]|[u063b-u063f]|u0674|[u06e5-u06e6]|u070f|[u076e-u077f]|u0a51|u0a75|u0b44|[u0b62-u0b63]|[u0c62-u0c63]|[u0ce2-u0ce3]|[u0d62-u0d63]|u135f|[u200b-u200f]|[u2028-u202e]|u2044|u2071|[uf701-uf70e]|[uf710-uf71a]|ufb1e|[ufc5e-ufc62]|ufeff|ufffc
java代码如下:
private String replaceWrongUnicode(String source, String replace) { if (StringUtils.isBlank(source)) { return source; } if (StringUtils.isBlank(replace)) { replace = ""; } Pattern CRLF = Pattern.compile("([u007f-u009f]|u00ad|[u0483-u0489]|[u0559-u055a]|u058a|[u0591-u05bd]|u05bf|[u05c1-u05c2]|[u05c4-u05c7]|[u0606-u060a]|[u063b-u063f]|u0674|[u06e5-u06e6]|u070f|[u076e-u077f]|u0a51|u0a75|u0b44|[u0b62-u0b63]|[u0c62-u0c63]|[u0ce2-u0ce3]|[u0d62-u0d63]|u135f|[u200b-u200f]|[u2028-u202e]|u2044|u2071|[uf701-uf70e]|[uf710-uf71a]|ufb1e|[ufc5e-ufc62]|ufeff|ufffc)"); Matcher m = CRLF.matcher(source); if (m.find()) { return m.replaceAll(replace); } return source; }
附:过滤
成
private String replaceEnter(String source) { if (StringUtils.isBlank(source)) { return source; } Pattern CRLF = Pattern.compile("( | | | )"); Matcher m = CRLF.matcher(source); if (m.find()) { return m.replaceAll("
"); } return source; }
更多java知识请关注java基础教程栏目。