【avalon源码解析】【黑客入侵源码】【主力先锋源码】mapreduce 源码-皮皮网

【avalon源码解析】【黑客入侵源码】【主力先锋源码】mapreduce 源码

2025-01-31 11:14:38 来源：焦点分类：焦点

1.å¦ä½åå¸å¼è¿è¡mapreduceç¨åº
2.å¦ä½å¨MaxComputeä¸è¿è¡HadoopMRä½ä¸
3.3、MapReduce详解与源码分析
4.MapReduce源码解析之InputFormat

mapreduce 源码

å¦ä½åå¸å¼è¿è¡mapreduceç¨åº

ä¸ã é¦åè¦ç¥éæ¤åæ è½¬è½½

ããä¼°è®¡å¾ç ç©¶org.apache.hadoop.conf.Configurationçæºç ï¼åæ£xmléç½®æä»¶ä¼å½±åæ§è¡mapreduceä½¿ç¨çæä»¶ç³»ç»æ¯æ¬æºçwindowsæä»¶ç³»ç»è¿æ¯è¿ç¨çhdfsç³»ç»; è¿æå½±åæ§è¡mapreduceçmapperåreducerçæ¯æ¬æºçjvmè¿æ¯éç¾¤éé¢æºå¨çjvm

ããäºã æ¬æçç»è®º

ããç¬¬äºç¹å°±æ¯ï¼ Linuxä¸ï¼åªéæ·è´jaræä»¶å°éç¾¤masterä¸,æ§è¡å½ä»¤hadoop jarPackage.jar MainClassNameå³å¯åå¸å¼è¿è¡mapreduceç¨åºã

ããè¯·ååèåæäºç¯ï¼

ããHadoopä½ä¸æäº¤åæï¼ä¸ï¼~~ï¼äºï¼

ããpublic static File createPack() throws IOException {

ããFile jarFile = EJob.createTempJar("bin");

ããClassLoader classLoader = EJob.getClassLoader();

ããThread.currentThread().setContextClassLoader(classLoader);

ããreturn jarFile;

ãã}

ããå¨ä½ä¸å¯å¨ä»£ç ä¸ä½¿ç¨æåï¼

ããJob job = Job.getInstance(conf, "testAnaAction");

ããæ·»å ï¼

ããString jarPath = createPack().getPath();

ããjob.setJar(jarPath);

ããå³å¯å®ç°ç´æ¥run as java application å¨windowsè·åå¸å¼çmapreduceç¨åºï¼ä¸ç¨æå·¥ä¸ä¼ jaræä»¶ã

ããéäºãå¾åºç»è®ºçæµè¯è¿ç¨

ããï¼æªæç©ºçä¹¦ï¼åªè½éè¿æç¬¨çæµè¯æ¹æ³å¾åºç»è®ºäºï¼

ããä¸. ç´æ¥éè¿windowsä¸Eclipseå³å»mainç¨åºçjavaæä»¶ï¼ç¶å"run as application"æéæ©hadoopæä»¶"run on hadoop"æ¥è§¦åæ§è¡MapReduceç¨åºçæµè¯ã

ãã[work] -- ::, - org.apache.hadoop.mapreduce.Job - [main] INFO org.apache.hadoop.mapreduce.Job - map 0% reduce 0%

ãã[work] -- ::, - org.apache.hadoop.mapreduce.Job - [main] INFO org.apache.hadoop.mapreduce.Job - Task Id : attempt___m__0, Status : FAILED

ããError: java.lang.RuntimeException: java.lang.ClassNotFoundException: Class bookCount.BookCount$BookCountMapper not found

ããat org.apache.hadoop.conf.Configuration.getClass(Configuration.java:)

ããat org.apache.hadoop.mapreduce.task.JobContextImpl.getMapperClass(JobContextImpl.java:)

ããat org.apache.hadoop.mapred.MapTask.runNewMapper(MapTask.java:)

ããat org.apache.hadoop.mapred.MapTask.run(MapTask.java:)

ããat org.apache.hadoop.mapred.YarnChild$2.run(YarnChild.java:)

ããat java.security.AccessController.doPrivileged(Native Method)

ããat javax.security.auth.Subject.doAs(Subject.java:)

ããat org.apache.hadoop.security.UserGroupInformation.doAs(UserGroupInformation.java:)

ããat org.apache.hadoop.mapred.YarnChild.main(YarnChild.java:)

ããCaused by: java.lang.ClassNotFoundException: Class bookCount.BookCount$BookCountMapper not found

ããat org.apache.hadoop.conf.Configuration.getClassByName(Configuration.java:)

ããat org.apache.hadoop.conf.Configuration.getClass(Configuration.java:)

ãã... 8 more

ãã# Error:åéå¤ä¸æ¬¡

ãã-- ::, - org.apache.hadoop.mapreduce.Job - [main] INFO org.apache.hadoop.mapreduce.Job - map % reduce %

ããç°è±¡å°±æ¯ï¼æ¥éï¼æ è¿åº¦ï¼æ è¿è¡ç»æã

ãã

ãã2ï¼æ·è´jaråå°âåªæ¯âéç¾¤masterç$HADOOP_HOME/share/hadoop/mapreduce/ç®å½ä¸ï¼ç´æ¥éè¿windowsçeclipse "run as application"åéè¿hadoopæä»¶"run on hadoop"æ¥è§¦åæ§è¡ï¼å®æ¥éåä¸ã

ããç°è±¡å°±æ¯ï¼æ¥éï¼æ è¿åº¦ï¼æ è¿è¡ç»æã

ãã3ï¼æ·è´jaråå°éç¾¤æäºslaveç$HADOOP_HOME/share/hadoop/mapreduce/ç®å½ä¸ï¼ç´æ¥éè¿windowsçeclipse "run as application"åéè¿hadoopæä»¶"run on hadoop"æ¥è§¦åæ§è¡

ããåæ¥éï¼

ããError: java.lang.RuntimeException: java.lang.ClassNotFoundException: Class bookCount.BookCount$BookCountMapper not found

ããat org.apache.hadoop.conf.Configuration.getClass(Configuration.java:)

ããat org.apache.hadoop.mapreduce.task.JobContextImpl.getMapperClass(JobContextImpl.java:)

ããåæ¥éï¼

ããError: java.lang.RuntimeException: java.lang.ClassNotFoundException: Class bookCount.BookCount$BookCountReducer not found

ãã

ããç°è±¡å°±æ¯ï¼ææ¥éï¼ä½ä»ç¶æè¿åº¦ï¼æè¿è¡ç»æã

å¦ä½å¨MaxComputeä¸è¿è¡HadoopMRä½ä¸

1. ä¸è½½HadoopMRçæä»¶

2. åå¤å¥½HadoopMRçç¨åºjarå

ç¼è¯å¯¼åºWordCountçjaråï¼wordcount_test.jar ï¼wordcountç¨åºçæºç å¦ä¸:

package com.aliyun.odps.mapred.example.hadoop;

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.fs.Path;

import org.apache.hadoop.io.IntWritable;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Job;

import org.apache.hadoop.mapreduce.Mapper;

import org.apache.hadoop.mapreduce.Reducer;

import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;

import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;

import java.io.IOException;

import java.util.StringTokenizer;

public class WordCount {

public static class TokenizerMapper

extends Mapper<Object, Text, Text, IntWritable>{

private final static IntWritable one = new IntWritable(1);

private Text word = new Text();

public void map(Object key, Text value, Context context

) throws IOException, InterruptedException {

StringTokenizer itr = new StringTokenizer(value.toString());

while (itr.hasMoreTokens()) {

word.set(itr.nextToken());

context.write(word, one);

}

public static class IntSumReducer

extends Reducer<Text,IntWritable,Text,IntWritable> {

private IntWritable result = new IntWritable();

public void reduce(Text key, Iterable<IntWritable> values,

Context context

) throws IOException, InterruptedException {

int sum = 0;

for (IntWritable val : values) {

sum += val.get();

}

result.set(sum);

context.write(key, result);

}

public static void main(String[] args) throws Exception {

Configuration conf = new Configuration();

Job job = Job.getInstance(conf, "word count");

job.setJarByClass(WordCount.class);

job.setMapperClass(TokenizerMapper.class);

job.setCombinerClass(IntSumReducer.class);

job.setReducerClass(IntSumReducer.class);

job.setOutputKeyClass(Text.class);

job.setOutputValueClass(IntWritable.class);

FileInputFormat.addInputPath(job, new Path(args[0]));

FileOutputFormat.setOutputPath(job, new Path(args[1]));

System.exit(job.waitForCompletion(true) ? 0 : 1);

}

3. æµè¯æ°æ®åå¤

åå»ºè¾å¥è¡¨åè¾åºè¡¨

create table if not exists wc_in(line string);

create table if not exists wc_out(key string, cnt bigint);

éè¿tunnelå°æ°æ®å¯¼å¥è¾å¥è¡¨ä¸

å¾å¯¼å¥ææ¬æä»¶data.txtçæ°æ®åå®¹å¦ä¸ï¼

hello maxcompute

hello mapreduce

tunnel upload data.txt wc_in;

4. åå¤å¥½è¡¨ä¸hdfsæä»¶è·¯å¾çæ å°å³ç³»éç½®

éç½®æä»¶å½åä¸ºï¼wordcount-table-res.conf

{

"file:/foo": {

"resolver": {

"resolver": "c.TextFileResolver",

"properties": {

"text.resolver.columns.combine.enable": "true",

"text.resolver.seperator": "\t"

}

"tableInfos": [

{

"tblName": "wc_in",

"partSpec": { },

"label": "__default__"

}

"matchMode": "exact"

"file:/bar": {

"resolver": {

"resolver": "openmr.resolver.BinaryFileResolver",

"properties": {

"binary.resolver.input.key.class" : "org.apache.hadoop.io.Text",

"binary.resolver.input.value.class" : "org.apache.hadoop.io.LongWritable"

}

"tableInfos": [

{

"tblName": "wc_out",

"partSpec": { },

"label": "__default__"

}

"matchMode": "fuzzy"

}

3、MapReduce详解与源码分析

文章目录

Split阶段

在MapReduce的流程中，Split阶段是将输入文件根据指定大小（默认MB）切割成多个部分，每个部分称为一个split。split的avalon源码解析大小由minSize、maxSize、blocksize决定。以wordcount代码为例，split数量由FileInputFormat的getSplits方法确定，返回值即为mapper的数量。默认情况下，黑客入侵源码mapper的数量是文件大小除以block大小。此步骤由FileInputFormat的子类TextInputFormat完成，它负责将输入文件分割为InputSplit，从而决定mapper的数量。

Map阶段

每个map task在执行过程中，会有内存缓冲区用于存储处理结果，缓冲区大小默认为MB，超过MB阈值时，数据将被写入磁盘作为临时文件，最后将所有临时文件合并为最终输出。在写入过程中，主力先锋源码数据将被分区、排序、并执行combine操作，以优化数据处理效率。

2.1

分区

MapReduce自带的分区器HashPartitioner将数据按照key值进行分区，确保数据均匀分布在reduce task之间。

2.2

排序

在完成分区后，数据会按照key值进行排序，以便后续的Shuffle阶段能够高效地将相同key值的数据汇聚到一起。

Shuffle阶段

Shuffle阶段是MapReduce的核心，负责数据从map task输出到reduce task输入的cryengine c 源码过程。reduce task会根据自己的分区号从各个map task中获取相应数据分区，之后会对这些文件进行合并（归并排序），将相同key值的数据汇聚到一起，为reduce阶段做好准备。

Reduce阶段

Reduce阶段分为抓取、合并、排序三个步骤。reduce task创建并行抓取线程，通过HTTP协议从完成的map task中获取结果文件。抓取的数据先保存在内存中，超过内存大小时，代码高亮源码数据将被溢写到磁盘。合并后的数据将按照key值排序，最终交给reduce函数进行计算，形成有序的计算结果。

调节Reduce任务数量

在处理大数据量时，调节Reduce任务数量是优化MapReduce性能的关键。如果设置过低，会导致节点资源闲置，效率低下。通常情况下，将Reduce任务设置为一个较大的值（最大值为），以充分利用资源。调节方法在于合理设置reduce task的数量，避免资源浪费，同时保证计算的高效性。

MapReduce源码解析之InputFormat

导读

深入探讨MapReduce框架的核心组件——InputFormat。此组件在处理多样化数据类型时，扮演着数据格式化和分片的角色。通过设置job.setInputFormatClass(TextInputFormat.class)等操作，程序能正确处理不同文件类型。InputFormat类作为抽象基础，定义了文件切分逻辑和RecordReader接口，用于读取分片数据。本节将解析InputFormat、InputSplit、RecordReader的结构与实现，以及如何在Map任务中应用此框架。

类图与源码解析

InputFormat类提供了两个关键抽象方法：getSplits()和createRecordReader()。getSplits()负责规划文件切分策略，定义逻辑上的分片，而RecordReader则从这些分片中读取数据。

InputSplit类承载了切分逻辑，表示了给定Mapper处理的逻辑数据块，包含所有K-V对的集合。

RecordReader类实现了数据读取流程，其子类如LineRecordReader，提供行数据读取功能，将输入流中的数据按行拆分，赋值为Key和Value。

具体实现与操作流程

在getSplits()方法中，FileInputFormat类负责将输入文件按照指定策略切分成多个InputSplit。

TextInputFormat类的createRecordReader()方法创建了LineRecordReader实例，用于读取文件中的每一行数据，形成K-V对。

Mapper任务执行时，通过调用RecordReader的nextKeyValue()方法，读取文件的每一行，完成数据处理。

在Map任务的run()方法中，MapContextImp类实例化了一个RecordReader，用于实现数据的迭代和处理。

总结

本文详细阐述了MapReduce框架中InputFormat的实现原理及其相关组件，包括类图、源码解析、具体实现与操作流程。后续文章将继续探讨MapReduce框架的其他关键组件源码解析，为开发者提供深入理解MapReduce的构建和优化方法。

【avalon源码解析】【黑客入侵源码】【主力先锋源码】mapreduce 源码

关注了本文的网友还关注：

相关推荐

一周热点