Hadoop & Hadoop Streaming 自定义输出格式,
在用Hadoop处理大量的日志文件的时候,有时候会将错误的或者不符合要求的日志输出到另外一个目录,以备后来进行查验,这里给出个简单的例子,并简单说明下如何在Hadoop Streaming中使用这种方法将错误格式的日志输出到自定义的路径。
例子中类MultiFilesOutput继承自MultipleTextOutputFormat<Text, Text>,可以自己定义不同的keyType,然后输出到不同的目录下。
在Hadoop Streaming,使用扩展的jar文件格式如下:
其中CustomOutputFormats.jar 为生成的jar文件名称,MultiFormats.MultiFilesOutput对应于package name和类名。
本站文章为和通数据库网友分享或者投稿,欢迎任何形式的转载,但请务必注明出处.
同时文章内容如有侵犯了您的权益,请联系QQ:970679559,我们会在尽快处理。