Hadoop学习笔记

今天开始要学习Hadoop！开始向“大数据”领域靠拢！

从头开始对于连何为Hadoop都不清楚的人，有好多东西要学，加油！

1.下载hadoop,官网地址：http://hadoop.apache.org/releases.html

2.将hadoop放在路径 usrlocalsrc中。并在usrlocal 中创建一个目录：hadoop

3.解压文件到usrlocalhadoop目录中,解压后即可使用

tar -zxvf hadoop-3.0.0-alpha1.tar.gz -C /usr/local/hadoop/

4.检查hadoop是否安装成功：

cd /usr/local/hadoop/hadoop-3.0.0-alpha1
./bin/hadoop version

显示结果如下：

5.Hadoop 默认模式为非分布式模式，无需进行其他配置即可运行。非分布式即单 Java 进程，方便进行调试。

Hadoop 附带了丰富的例子。

运行

./bin/hadoop jar ./share/hadoop/mapreduce/hadoop-mapreduce-examples-3.0.0-alpha1.jar

可以看到所有例子

6.我们选择运行 grep 例子，我们将 input 文件夹中的所有文件作为输入，筛选当中符合正则表达式 dfs[a-z.]+ 的单词并统计出现的次数，最后输出结果到 output 文件夹中。

mkdir ./input

cp ./etc/hadoop/*.xml ./input # 将配置文件作为输入文件

./bin/hadoop jar ./share/hadoop/mapreduce/hadoop-mapreduce-examples-*.jar grep ./input ./output 'dfs[a-z.]+'