欢迎投稿

今日深度:

Hadoop & Hadoop Streaming 自定义输出格式,

Hadoop & Hadoop Streaming 自定义输出格式,


    在用Hadoop处理大量的日志文件的时候,有时候会将错误的或者不符合要求的日志输出到另外一个目录,以备后来进行查验,这里给出个简单的例子,并简单说明下如何在Hadoop Streaming中使用这种方法将错误格式的日志输出到自定义的路径。

    例子中类MultiFilesOutput继承自MultipleTextOutputFormat<Text, Text>,可以自己定义不同的keyType,然后输出到不同的目录下。


 在Hadoop Streaming,使用扩展的jar文件格式如下:

其中CustomOutputFormats.jar 为生成的jar文件名称,MultiFormats.MultiFilesOutput对应于package name和类名。

www.htsjk.Com true http://www.htsjk.com/Hadoop/40606.html NewsArticle Hadoop lt;Text, Text,可以自己定义不同的keyType,然后输出到不同的目录下。 package MultiFormats;import org.apache.hadoop.fs.Path;import org.apache.hadoop.io.Text;import org.apache.hadoop.mapred.lib.MultipleTextOutputFo...
相关文章
    暂无相关文章
评论暂时关闭