一区二区三区在线-一区二区三区亚洲视频-一区二区三区亚洲-一区二区三区午夜-一区二区三区四区在线视频-一区二区三区四区在线免费观看

服務器之家:專注于服務器技術及軟件下載分享
分類導航

PHP教程|ASP.NET教程|JAVA教程|ASP教程|編程技術|正則表達式|C/C++|

服務器之家 - 編程語言 - JAVA教程 - java 爬蟲詳解及簡單實例

java 爬蟲詳解及簡單實例

2020-10-27 16:32飯飯_fan JAVA教程

這篇文章主要介紹了java 爬蟲詳解及簡單實例的相關資料,需要的朋友可以參考下

Java爬蟲

一、代碼

爬蟲的實質就是打開網頁源代碼進行匹配查找,然后獲取查找到的結果。

打開網頁:

?
1
URL url = new URL(http://www.cnblogs.com/Renyi-Fan/p/6896901.html);

讀取網頁內容:

?
1
BufferedReader bufr = new BufferedReader(new InputStreamReader(url.openStream()));

正則表達式進行匹配:

?
1
tring mail_regex = "\\w+@\\w+(\\.\\w+)+";

儲存結果:

?
1
List<String> list = new ArrayList<String>();

/*
* 獲取
* 將正則規則進行對象的封裝。
* Pattern p = Pattern.compile("a*b");
* //通過正則對象的matcher方法字符串相關聯。獲取要對字符串操作的匹配器對象Matcher .
* Matcher m = p.matcher("aaaaab");
* //通過Matcher匹配器對象的方法對字符串進行操作。
* boolean b = m.matches();
*/

?
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
import java.io.BufferedReader;
import java.io.FileNotFoundException;
import java.io.FileReader;
import java.io.IOException;
import java.io.InputStreamReader;
import java.net.URL;
import java.util.ArrayList;
import java.util.List;
import java.util.regex.Matcher;
import java.util.regex.Pattern;
 
public class Spider {
 
  public static void main(String[] args) throws IOException {
//    List<String> list = getMails();
//    for(String mail : list){
//      System.out.println(mail);
//    }
  
    List<String> list = getMailsByWeb();
    for(String mail : list){
      System.out.println(mail);
    }
  }
 
  public static List<String> getMailsByWeb() throws IOException{
    //1,讀取源文件。
    //URL url = new URL("http://192.168.1.100:8080/myweb/mail.html");
    //URL url = new URL("http://localhost:8080/SecondWeb/index.jsp");
    URL url = new URL("http://www.cnblogs.com/Renyi-Fan/p/6896901.html");
 
    BufferedReader bufr = new BufferedReader(new InputStreamReader(url.openStream()));
 
 
    //2,對讀取的數據進行規則的匹配。從中獲取符合規則的數據.
    String mail_regex = "\\w+@\\w+(\\.\\w+)+";
 
    List<String> list = new ArrayList<String>();
 
    Pattern p = Pattern.compile(mail_regex);
    String line = null;
 
    while((line=bufr.readLine())!=null){
 
      Matcher m = p.matcher(line);
      while(m.find()){
        //3,將符合規則的數據存儲到集合中。
        list.add(m.group());
      }
 
    }
    return list;
  }
 
  public static List<String> getMails() throws IOException{
    //1,讀取源文件。
    BufferedReader bufr = new BufferedReader(new FileReader("c:\\mail.html"));
 
 
    //2,對讀取的數據進行規則的匹配。從中獲取符合規則的數據.
    String mail_regex = "\\w+@\\w+(\\.\\w+)+";
 
    List<String> list = new ArrayList<String>();
 
    Pattern p = Pattern.compile(mail_regex);
    String line = null;
 
    while((line=bufr.readLine())!=null){
 
      Matcher m = p.matcher(line);
      while(m.find()){
        //3,將符合規則的數據存儲到集合中。
        list.add(m.group());
      }
 
    }
    return list;
  }
}

二、運行結果

?
1
2
abc1@sina.com.cn
1@1.1

感謝閱讀,希望能幫助到大家,謝謝大家對本站的支持!

原文鏈接:http://www.cnblogs.com/Renyi-Fan/p/6897023.html

延伸 · 閱讀

精彩推薦
主站蜘蛛池模板: 日韩在线视精品在亚洲 | 激情小视频| 久久人妻少妇嫩草AV無碼 | 欧美日韩国产手机在线观看视频 | 雪恋电影完整版免费观看 | 色哟哟国产成人精品 | 91你懂的| 鬼畜重口高h合集长短篇 | 国产xxx在线 | 亚洲福利 影院 | 日韩福利一区 | 国产一区二区免费福利片 | 亚洲精品卡一卡2卡3卡4卡 | 免费看国产精品麻豆 | 九九国产在线观看 | 国产成人免费视频 | 91在线高清视频 | 香蕉久久高清国产精品免费 | 免费观看日本视频 | 精东影业传媒全部作品 | 狠狠干2017| 嗯啊视频在线观看 | 成品人视频免费观看 | 男人躁女人过程 | 亚洲 欧美 偷自乱 图片 | 天堂俺去俺来也www久久婷婷 | 日韩日日操 | 免费观看成年肉动漫网站 | 久久婷婷五月综合色丁香花 | 欧美三级免费观看 | 91丝袜足控免费网站xx | 日韩高清一区二区 | 500第一精品 | 天天舔天天干天天操 | 欧美日韩亚洲高清不卡一区二区三区 | 91精品国产色综合久久不卡蜜 | 91精品大神国产在线播放 | 日本护士厕所xxx | 国产激情视频网站 | 亚洲国产精品综合久久网络 | 欧美人与禽杂交大片 |