Hadoop计数器的应用以及数据清洗

更新时间：2019年01月10日 09:11:27 作者：qq_43193797

今天小编就为大家分享一篇关于Hadoop计数器的应用以及数据清洗，小编觉得内容挺不错的，现在分享给大家，具有很好的参考价值，需要的朋友一起跟随小编来看看吧

数据清洗（ETL）

在运行核心业务MapReduce程序之前，往往要先对数据进行清洗，清理掉不符合用户要求的数据。清理的过程往往只需要运行Mapper程序，不需要运行Reduce程序。

1．需求

去除日志中字段长度小于等于11的日志。

（1）输入数据

web.log

（2）期望输出数据

每行字段长度都大于11

2．需求分析

需要在Map阶段对输入的数据根据规则进行过滤清洗。

3．实现代码

（1）编写LogMapper类

package com.atguigu.mapreduce.weblog;
import java.io.IOException;
import org.apache.hadoop.io.LongWritable;
import org.apache.hadoop.io.NullWritable;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Mapper;
public class LogMapper extends Mapper<LongWritable, Text, Text, NullWritable>{
  Text k = new Text();
  @Override
  protected void map(LongWritable key, Text value, Context context) throws IOException, InterruptedException {
   // 1 获取1行数据
   String line = value.toString();
   // 2 解析日志
   boolean result = parseLog(line,context);
   // 3 日志不合法退出
   if (!result) {
     return;
   }
   // 4 设置key
   k.set(line);
   // 5 写出数据
   context.write(k, NullWritable.get());
  }
  // 2 解析日志
  private boolean parseLog(String line, Context context) {
   // 1 截取
   String[] fields = line.split(" ");
   // 2 日志长度大于11的为合法
    if (fields.length > 11) {
     // 系统计数器
     context.getCounter("map", "true").increment(1);
     return true;
   }else {
     context.getCounter("map", "false").increment(1);
     return false;
   }
  }
}

（2）编写LogDriver类

package com.atguigu.mapreduce.weblog;
import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.io.NullWritable;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Job;
import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;
import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;
public class LogDriver {
  public static void main(String[] args) throws Exception {
// 输入输出路径需要根据自己电脑上实际的输入输出路径设置
    args = new String[] { "e:/input/inputlog", "e:/output1" };
   // 1 获取job信息
   Configuration conf = new Configuration();
   Job job = Job.getInstance(conf);
   // 2 加载jar包
   job.setJarByClass(LogDriver.class);
   // 3 关联map
   job.setMapperClass(LogMapper.class);
   // 4 设置最终输出类型
   job.setOutputKeyClass(Text.class);
   job.setOutputValueClass(NullWritable.class);
   // 设置reducetask个数为0
   job.setNumReduceTasks(0);
   // 5 设置输入和输出路径
   FileInputFormat.setInputPaths(job, new Path(args[0]));
   FileOutputFormat.setOutputPath(job, new Path(args[1]));
   // 6 提交
   job.waitForCompletion(true);
  }
}

总结

以上就是这篇文章的全部内容了，希望本文的内容对大家的学习或者工作具有一定的参考学习价值，谢谢大家对脚本之家的支持。如果你想了解更多相关内容请查看下面相关链接

您可能感兴趣的文章:

ubuntu 服务器中mysql的安装与连接方法
这篇文章主要介绍了ubuntu 服务器中mysql的安装与连接方法,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友可以参考下
2024-01-01
ibmx335/ibmx336服务器做RAID阵列的图文方法(包括删除RAID阵列)
X服务器中有一些集成LSI SCSI控制器的机型,在开机自检时按CTRL C可以配置两个硬盘的镜像。但是当升级BIOS之后，CTRL C中的一些设置发生了变化，配置方法也较以前的版本有些差异
2012-06-06
常用的web服务器软件整理(win+linux)
这篇文章主要介绍了常用的web服务器软件整理,包括windows与linux下的,需要的朋友可以参考下
2017-12-12
http跟https有什么区别
这篇文章主要介绍了http跟https的区别，非常不错，具有参考借鉴价值，需要的朋友参考下吧
2018-02-02
服务器错误码500 501 502 503 504 505 详解
这篇文章主要介绍了服务器错误码500 501 502 503 504 505 详解,需要的朋友可以参考下
2015-07-07
git冲突解决_动力节点Java学院整理
这篇文章主要介绍了git冲突解决,小编觉得挺不错的，现在分享给大家，也给大家做个参考。一起跟随小编过来看看吧
2017-08-08
IBM服务器诊断面板使用方法
IBM服务器一般会有一个服务器操作员信息面板(诊断面板)，服务器一般的硬件故障都会在诊断面板上提示，但这些提示可能只是一个大概的诊断故障，有助于系统管理员更好的维护
2018-05-05
阿里云k8s服务springboot项目应用升级时出现502错误
这篇文章主要介绍了阿里云k8s服务springboot项目应用升级时出现502错误,需要的朋友可以参考下
2022-04-04
戴尔dell poweredge r730服务器系统安装配置详解教程
这篇文章主要介绍了戴尔dell poweredge r730服务器系统安装配置详解教程,需要的朋友可以参考下
2018-05-05
Centos服务器部署前后端项目的实战教程
这篇文章主要介绍了Centos服务器部署前后端项目的实战教程,本文通过实例图文结合实例代码给大家介绍的非常详细,需要的朋友参考下吧
2024-02-02

Hadoop计数器的应用以及数据清洗

相关文章

最新评论

大家感兴趣的内容

最近更新的内容

常用在线小工具