Windows下Java调用OCR进行图片识别

更新时间：2018年12月13日 11:58:21 作者：coco_ethan

这篇文章主要为大家详细介绍了Windows下Java调用OCR进行图片识别，通过Tesseract-OCR对图片进行识别，具有一定的参考价值，感兴趣的小伙伴们可以参考一下

使用Java语言，通过Tesseract-OCR对图片进行识别。

1.Tesseract-OCR

下载windows版本并安装。

2.程序如下：

a.ImageIOHelper类

package OCR;
 
import java.awt.image.BufferedImage;
import java.io.File;
import java.io.IOException;
import java.util.Iterator;
import java.util.Locale;
 
import javax.imageio.IIOImage;
import javax.imageio.ImageIO;
import javax.imageio.ImageReader;
import javax.imageio.ImageWriteParam;
import javax.imageio.ImageWriter;
import javax.imageio.metadata.IIOMetadata;
import javax.imageio.stream.ImageInputStream;
import javax.imageio.stream.ImageOutputStream;
 
import com.sun.media.imageio.plugins.tiff.TIFFImageWriteParam;
 
public class ImageIOHelper {
 /**
 * 图片文件转换为tif格式
 * @param imageFile 文件路径
 * @param imageFormat 文件扩展名
 * @return
 */
 public static File createImage(File imageFile, String imageFormat) {
 File tempFile = null;
 try {
  Iterator<ImageReader> readers = ImageIO.getImageReadersByFormatName(imageFormat);
  ImageReader reader = readers.next();
 
  ImageInputStream iis = ImageIO.createImageInputStream(imageFile);
  reader.setInput(iis);
  //Read the stream metadata
  IIOMetadata streamMetadata = reader.getStreamMetadata();
  
  //Set up the writeParam
  TIFFImageWriteParam tiffWriteParam = new TIFFImageWriteParam(Locale.CHINESE);
  tiffWriteParam.setCompressionMode(ImageWriteParam.MODE_DISABLED);
  
  //Get tif writer and set output to file
  Iterator<ImageWriter> writers = ImageIO.getImageWritersByFormatName("tiff");
  ImageWriter writer = writers.next();
  
  BufferedImage bi = reader.read(0);
  IIOImage image = new IIOImage(bi,null,reader.getImageMetadata(0));
  tempFile = tempImageFile(imageFile);
  ImageOutputStream ios = ImageIO.createImageOutputStream(tempFile);
  writer.setOutput(ios);
  writer.write(streamMetadata, image, tiffWriteParam);
  ios.close();
  
  writer.dispose();
  reader.dispose();
  
 } catch (IOException e) {
  e.printStackTrace();
 }
 return tempFile;
 }
 
 private static File tempImageFile(File imageFile) {
 String path = imageFile.getPath();
 StringBuffer strB = new StringBuffer(path);
 strB.insert(path.lastIndexOf('.'),0);
 return new File(strB.toString().replaceFirst("(?<=//.)(//w+)$", "tif"));
 }
 
}

b.OCR核心类

package OCR;
 
import java.io.BufferedReader;
import java.io.File;
import java.io.FileInputStream;
import java.io.InputStreamReader;
import java.util.ArrayList;
import java.util.List;
 
import org.jdesktop.swingx.util.OS;
 
public class OCR {
 private final String LANG_OPTION = "-l"; //英文字母小写l，并非数字1
 private final String EOL = System.getProperty("line.separator");
 private String tessPath = "C://Program Files//Tesseract-OCR";
 //private String tessPath = new File("tesseract").getAbsolutePath();
 
 public String recognizeText(File imageFile,String imageFormat)throws Exception{
 File tempImage = ImageIOHelper.createImage(imageFile,imageFormat);
 File outputFile = new File(imageFile.getParentFile(),"output");
 StringBuffer strB = new StringBuffer();
 List<String> cmd = new ArrayList<String>();
 if(OS.isWindowsXP()){
  cmd.add(tessPath+"//tesseract");
 }else if(OS.isLinux()){
  cmd.add("tesseract");
 }else{
  cmd.add(tessPath+"//tesseract");
 }
 cmd.add("");
 cmd.add(outputFile.getName());
 //cmd.add(LANG_OPTION);
 //cmd.add("chi_sim");
 //cmd.add("eng");
 
 ProcessBuilder pb = new ProcessBuilder();
 pb.directory(imageFile.getParentFile());
 
 cmd.set(1, tempImage.getName());
 pb.command(cmd);
 pb.redirectErrorStream(true);
 
 Process process = pb.start();
 //tesseract.exe 1.jpg 1 -l chi_sim
 int w = process.waitFor();
 
 //删除临时正在工作文件
 tempImage.delete();
 
 if(w==0){
  BufferedReader in = new BufferedReader(new InputStreamReader(new FileInputStream(outputFile.getAbsolutePath()+".txt"),"UTF-8"));
  
  String str;
  while((str = in.readLine())!=null){
  strB.append(str).append(EOL);
  }
  in.close();
 }else{
  String msg;
  switch(w){
  case 1:
   msg = "Errors accessing files.There may be spaces in your image's filename.";
   break;
  case 29:
   msg = "Cannot recongnize the image or its selected region.";
   break;
  case 31:
   msg = "Unsupported image format.";
   break;
  default:
   msg = "Errors occurred.";
  }
  tempImage.delete();
  //throw new RuntimeException(msg);
 }
 new File(outputFile.getAbsolutePath()+".txt").delete();
 return strB.toString();
 }
}

c.main

package OCR;
import java.io.File;
import java.io.IOException;
 
public class TestOcr {
 
 /**
 * @param args
 */
 public static void main(String[] args) {
 //输入图片地址
 String path = "d://test//test.bmp";  
    try {  
      String valCode = new OCR().recognizeText(new File(path), "bmp");  
      System.out.println(valCode);  
    } catch (IOException e) {  
      e.printStackTrace();  
    } catch (Exception e) {
  e.printStackTrace();
 }  
 }
 
}

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持脚本之家。

您可能感兴趣的文章:

Spring常用数据源的xml配置详解
这篇文章主要介绍了Spring常用数据源的xml配置详解,数据源是连接到数据库的一类路径，它包含了访问数据库的信息(地址、用户名、密码),数据源就像是排水管道,需要的朋友可以参考下
2023-07-07
使用Springboot注入带参数的构造函数实例
这篇文章主要介绍了使用Springboot注入带参数的构造函数实例，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2020-04-04
浅谈JAVASE单例设计模式
整理笔记的时候发现以前写的单利设计模式的文章，贴出来给大家分享下！有需要的小伙伴可以来参考下
2015-11-11
JAVA 实现延迟队列的方法
这篇文章主要介绍了JAVA 实现延迟队列的方法，文中讲解非常详细，供大家参考和学习，感兴趣的朋友可以了解下
2020-06-06
浅谈java中守护线程与用户线程
本篇文章主要介绍了浅谈java中守护线程与用户线程，小编觉得挺不错的，现在分享给大家，也给大家做个参考。一起跟随小编过来看看吧
2017-09-09
JAVA简单选择排序算法原理及实现
选择排序（Selection Sort ）分为两种简单选择排序（Simple Selection Sort）和树形选择排序
2014-01-01
基于OpenCV与JVM实现矩阵处理图像
本文主要介绍了Java图像处理实战之基于OpenCV与JVM实现矩阵处理图像。文中的示例代码讲解详细，对我们学习图像处理有一定的帮助，感兴趣的可以试一试
2022-01-01
SpringBoot如何实现并发任务并返回结果
这篇文章主要介绍了SpringBoot如何实现并发任务并返回结果问题，具有很好的参考价值，希望对大家有所帮助。如有错误或未考虑完全的地方，望不吝赐教
2023-07-07
Java使用反射和动态代理实现一个View注解绑定库
这篇文章主要介绍了Java使用反射和动态代理实现一个View注解绑定库,代码简洁，使用简单，扩展性强，结合实例代码给大家介绍的非常详细，需要的朋友可以参考下
2022-05-05
详解Java面向对象编程中方法的使用
这篇文章主要介绍了详解Java面向对象编程中方法的使用,包括方法的重载和参数以及泛型方法等知识点,需要的朋友可以参考下
2016-02-02

Windows下Java调用OCR进行图片识别

相关文章

最新评论

大家感兴趣的内容

最近更新的内容

常用在线小工具