一个 MapReduce / Hive 作业 99% 的 Reduce 任务几分钟完成,最后 1 个跑了一小时。最可能的原因是?

大数据基础

  1. A.HDFS 副本数设置过大,最后一个 Reducer 要等所有副本写完
  2. B.数据倾斜:NULL 或热点 key 的数据量远超其他 key,落到同一 Reducer
  3. C.Map 任务数太少
  4. D.集群网络带宽不足