首页 > Web开发 > 详细

jsoup之文本过滤

时间:2015-07-17 02:15:53      阅读:501      评论:0      收藏:0      [点我收藏+]

背景:

基于jsoup(v 1.6.3)解析出来的网页内容进行过滤不需要的内容比如<script>

实现:

一种方式是基于tag的白名单,这种方式明显没有黑名单合适,不过jsoup木有提供黑名单功能

直接基于正则,常用的如下:

如:过滤<script>

String reg = "<\\s*?script[^>]*?>[\\s\\S]*?<\\s*?/\\s*?script\\s*?>";
Pattern pattern = Pattern.compile(reg);
Matcher matcher = pattern.matcher(content.html());
articleVo.setContent(matcher.replaceAll(""));

jsoup之文本过滤

原文:http://snv.iteye.com/blog/2227800

(0)
(0)
   
举报
评论 一句话评论(0
关于我们 - 联系我们 - 留言反馈 - 联系我们:wmxa8@hotmail.com
© 2014 bubuko.com 版权所有
打开技术之扣,分享程序人生!