mapreduce 关于小文件导致任务缓慢的问题

小文件导致任务执行缓慢的原因:

1.很容易想到的是map task 任务启动太多,而每个文件的实际输入量很小,所以导致了任务缓慢

   这个可以通过 CombineTextInputFormat,解决,主要需要设置 mapreduce.input.fileinputformat.split.maxsize(单位byte)

2.其次是set input 文件太多,需要一个一个set ,所以花费的时间很多,导致任务启动就很慢了

   这个只能提前merge好小文件,组成大文件,可能还有更好的办法,需要再研究

原文地址:https://www.cnblogs.com/yako/p/5403673.html