Java实现一个小说采集程序的简单实例

 更新时间:2016年06月22日 11:08:29   投稿:jingxian  
下面小编就为大家带来一篇Java实现一个小说采集程序的简单实例。小编觉得挺不错的, 现在就分享给大家,也给大家做个参考。一起跟随小编过来看看吧

被标题吸引进来的不要骂我。

只是一个简单的实现,随手写了来下载一部喜欢的小说的。示例中的小说只是示例,不是我的菜。

使用了jsoup。挺好用的一个工具。

有需要的话,参考下自己改吧。挺简单的,是吧。

代码如下:

package com.zhyea.doggie;

import java.io.File;
import java.io.FileWriter;
import java.io.IOException;

import org.jsoup.Jsoup;
import org.jsoup.nodes.Document; 
import org.jsoup.select.Elements;

public class Doggie {

  public static void main(String[] args){
    try{
      File txtFile = new File("D:/无限崩坏.txt");
      createTxtDoc(txtFile); 
      addContent(txtFile);
    }catch(Exception e){
      e.printStackTrace();
    }
      
  }
  
  /**
   * 向小说文件中添加内容
   * @param txtFile
   *       小说文件
   * @throws IOException
   * @throws InterruptedException
   */
  private static void addContent(File txtFile) throws IOException, InterruptedException{
    appendTxt(txtFile, getBookInfo("无限崩坏", "啪啪啪狂魔"));
    String url = "http://www.83kxs.com/View/12/12653/{pattern}.html";
    for(int i=5850686; i<=5945501; i++){
      try{
        String tmp = url.replace("{pattern}", i+"");
        appendTxt(txtFile, getPageContent(tmp));
      }catch(Exception e){
        e.printStackTrace();
        continue;
      }
    }
  }
    
  /**
   * 设置书名和作者
   * @param bookName
   *         书名
   * @param author
   *         作者
   * @return
   */
  private static String getBookInfo(String bookName, String author){
    return COMMON.replace("{book}", bookName).replace("{author}", author);
  }  
  
  /**
   * 读取页面内容
   * @param url
   *      访问路径       
   * @return
   * @throws IOException 
   */
  private static String getPageContent(String url) throws IOException{
    String rtn = null;
    
    Document doc = Jsoup.connect(url).get();
    Elements content = doc.select(".text p");
    Elements title = doc.select("#title");
    
    System.out.println(title.text());
    
    content.select("font").remove();
    content.select("script").remove();
    content.select("ins").remove();
    content.select("a").remove();
      
    rtn = title.text() + NEWLINE 
      + content.html().replaceAll("<p>", "")
              .replaceAll("</p>", "")
              .replaceAll("\\<!--(.+)--\\>", "")
              .replaceAll("&nbsp;", "")
              .replaceAll("<br>", NEWLINE)
      + NEWLINE;
    
    return rtn;
  }
  
  /**
   * 创建新的txt文件
   * @param fullName
   *       文件全名
   * @return
   * @throws Exception
   */
  private static boolean createTxtDoc(File txtFile) throws Exception{
    try{
      return txtFile.createNewFile();
    }catch(Exception e){
      throw e;
    }
  }
  
  
  /**
   * 向txt文件中追加内容
   * @param txtFile
   *       要操作的txt文件
   * @param content
   *       要追加的内容
   * @throws IOException
   */
  private static void appendTxt(File txtFile, String content) throws IOException{
    FileWriter writer = null;
    try{
      writer = new FileWriter(txtFile, true);
      writer.append(content);
    }finally{
      if(null!=writer)writer.close();
    }
  }
  
  /**
   * 换行符
   */
  static final String NEWLINE = System.getProperty("line.separator");
  
  /**
   * 书前的通用信息
   */
  static String COMMON = "------------------------------------------------------------------" + NEWLINE
                + "--------------- 书名:{book}" + NEWLINE
                + "--------------- 作者:{author}" + NEWLINE
                + "--------------- zhyea.com" + NEWLINE
                + "------------------------------------------------------------------" + NEWLINE;
  
}

以上就是小编为大家带来的Java实现一个小说采集程序的简单实例全部内容了,希望大家多多支持脚本之家~

相关文章

  • java使用FastJson解析Json数据

    java使用FastJson解析Json数据

    本篇文章主要介绍了java使用FastJson解析Json数据,fastjson 是一个性能极好的用 Java 语言实现的 JSON 解析器和生成器,有兴趣的可以了解一下。
    2017-02-02
  • ElasticSearch的安装与基本概念

    ElasticSearch的安装与基本概念

    这篇文章主要介绍了ElasticSearch的安装与基本概念,提供了一个分布式多用户能力的全文搜索引擎,Elasticsearch是用Java开发的,需要的朋友可以参考下
    2023-04-04
  • 基于spring @Cacheable 注解的spel表达式解析执行逻辑

    基于spring @Cacheable 注解的spel表达式解析执行逻辑

    这篇文章主要介绍了spring @Cacheable 注解的spel表达式解析执行逻辑,具有很好的参考价值,希望对大家有所帮助。如有错误或未考虑完全的地方,望不吝赐教
    2022-01-01
  • Java数据结构之队列(动力节点Java学院整理)

    Java数据结构之队列(动力节点Java学院整理)

    队列(Queue)是只允许在一端进行插入,而在另一端进行删除的运算受限的线性表。 这篇文章详细给大家介绍了java数据结构之队列,感兴趣的朋友跟随小编一起学习吧
    2017-04-04
  • Java中启动线程start和run的两种方法

    Java中启动线程start和run的两种方法

    start()方法它的作用是启动一个新线程,run()就和普通的成员方法一样,可以被重复调用。接下来通过本文给大家分享Java中启动线程start和run的两种方法,需要的朋友参考下吧
    2017-11-11
  • java设计模式理解依赖于抽象不依赖具体的分析

    java设计模式理解依赖于抽象不依赖具体的分析

    这篇文章主要为大家介绍了java设计模式的规则,理解依赖于抽象不依赖具体的示例分析,有需要的朋友可以借鉴参考下,希望能够有所帮助
    2021-10-10
  • serialVersionUID作用全面解析

    serialVersionUID作用全面解析

    这篇文章全面解析了java中serialVersionUID的作用,具有一定的参考价值,感兴趣的小伙伴们可以参考一下
    2017-06-06
  • Java中的分布式锁与同步锁使用详解

    Java中的分布式锁与同步锁使用详解

    这篇文章主要介绍了Java中的分布式锁与同步锁使用详解,在分布式系统中,由于存在多个节点并行执行任务,可能会出现竞争条件和数据不一致的问题,分布式锁通过约束同一时刻只有一个节点能够获得锁的方式,确保了对共享资源的独占访问,需要的朋友可以参考下
    2023-07-07
  • SpringBoot集成JWT生成token及校验方法过程解析

    SpringBoot集成JWT生成token及校验方法过程解析

    这篇文章主要介绍了SpringBoot集成JWT生成token及校验方法过程解析,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下
    2020-04-04
  • 浅谈java定时器的发展历程

    浅谈java定时器的发展历程

    这篇文章主要介绍了浅谈java定时器的发展历程,具有一定借鉴价值,需要的朋友可以参考下。
    2017-12-12

最新评论