Rss订阅

首页 »Java教程 » hadoop:分布式计算开源框架Hadoop入门实战( 2) »正文

hadoop:分布式计算开源框架Hadoop入门实战( 2)

来源: 发布时间:星期四, 2009年1月8日浏览:41次评论:0

　　其实参看Hadoop官方文档已经能够很容易配置分布式框架运行环境了

不过这里既然写了就再多写

点

同时有

些细节需要注意

也介绍说明

下

其实也就是这些细节会让人摸索半天

Hadoop可以单机跑

也可以配置集群跑

单机跑就不需要多说了

只需要按照Demo

运行介绍说明直接执行命令即可

这里主要重点说

下集群配置运行

过程

　　环境　　7台普通

机器

操作系统都是Linux

内存和CPU就不说了

反正Hadoop

大特点就是机器在多不在精

JDK必须是1.5以上

这个切记

7台机器

机器名务必区别

后续会谈到机器名对于MapReduce有很大

影响

　　部署考虑　　正如上面我描述

对于Hadoop

集群来说

可以分成两大类角色:Master和Slave

前者主要配置NameNode和JobTracker

角色

负责总管分布式数据和分解任务

执行

后者配置DataNode和TaskTracker

角色

负责分布式数据存储以及任务

执行

本来我打算看看

台机器是否可以配置成Master

同时也作为Slave使用

不过发现在NameNode

化

过程中以及TaskTracker执行过程中机器名配置好像有冲突(NameNode和TaskTracker对于Hosts

配置有些冲突

究竟是把机器名对应IP放在配置前面还是把Localhost对应IP放在前面有点问题

不过可能也是我自己

问题吧

这个大家可以根据实施情况给我反馈)

最后反正决定

台Master

6台Slave

后续复杂

应用开发和测试结果

比对会增加机器配置

　　实施步骤　　在所有

机器上都建立相同

也可以就建立相同

用户

以该用户

home路径来做hadoop

安装路径

例如我在所有

机器上都建立了/home/wenchu

　　下载Hadoop

先解压到Master上

这里我是下载

0.17.1

版本

此时Hadoop

安装路径就是/home/wenchu/hadoop-0.17.1

　　解压后进入conf目录

主要需要修改以下文件:hadoop-env.sh

hadoop-site.xml、masters、slaves

　　Hadoop

基础配置文件是hadoop-default.xml

看Hadoop

代码可以知道

默认建立

个Job

时候会建立Job

Config

Config首先读入hadoop-default.xml

配置

然后再读入hadoop-site.xml

配置(这个文件

时候配置为空)

hadoop-site.xml中主要配置你需要覆盖

hadoop-default.xml

系统级配置

以及你需要在你

MapReduce过程中使用

自定义配置(具体

些使用例如final等参考文档)

　　以下是

个简单

hadoop-site.xml

配置:

<?xml version="1.0"?>
<?xml-stylesheet type="text/xsl" href="configuration.xsl"?>
<!-- Put site-specic property overrides in this file. -->
<configuration>
<property>
　 <name>fs.default.name</name>//你namenode配置机器名加端口
　 <value>hdfs://10.2.224.46:54310/</value>
</property>
<property>
　 <name>mapred.job.tracker</name>//你JobTracker配置机器名加端口
　 <value>hdfs://10.2.224.46:54311/</value>
</property>
<property>
　 <name>dfs.replication</name>//数据需要备份数量默认是 3
　 <value>1</value>
</property>
<property>
　　<name>hadoop.tmp.dir</name>//Hadoop默认临时路径这个最好配置如果在新增节点或者其他情况下莫名其妙DataNode启动不了就删除此文件中tmp目录即可不过如果删除了NameNode机器此目录那么就需要重新执行NameNode格式化命令
　　<value>/home/wenchu/hadoop/tmp/</value>
</property>
<property>
　 <name>mapred.child.java.opts</name>//java虚拟机些参数可以参照配置
　 <value>-Xmx512m</value>
</property>
<property>
　<name>dfs.block.size</name>//block大小单位字节后面会提到用处必须是512倍数采用crc作文件完整性校验默认配置512是checksum最小单元
　<value>5120000</value>
　<description>The default block size for  files.</description>
</property>
</configuration>

　　hadoop-env.sh文件只需要修改

个参数:

# The java implementation to use.　Required.
export JAVA_HOME=/usr/ali/jdk1.5.0_10

　　配置你

Java路径

记住

定要1.5版本以上

免得莫名其妙出现问题

　　Masters中配置Masters

IP或者机器名

如果是机器名那么需要在/etc/hosts中有所设置

Slaves中配置

是Slaves

IP或者机器名

同样如果是机器名需要在/etc/hosts中有所设置

范例如下

我这里配置

都是IP:

Masters:
10.2.224.46
　Slaves:
10.2.226.40
10.2.226.39
10.2.226.38
10.2.226.37
10.2.226.41
10.2.224.36

　　建立Master到每

台Slave

SSH受信证书

由于Master将会通过SSH启动所有Slave

Hadoop

所以需要建立单向或者双向证书保证命令执行时不需要再输入密码

在Master和所有

Slave机器上执行:ssh-keygen -t rsa

执行此命令

时候

看到提示只需要回车

然后就会在/root/.ssh/下面产生id_rsa.pub

证书文件

通过scp将Master机器上

这个文件拷贝到Slave上(记得修改名称)

例如:scp root@masterIP:/root/.ssh/id_rsa.pub /root/.ssh/46_rsa.pub

然后执行cat /root/.ssh/46_rsa.pub >>/root/.ssh/authorized_keys

建立authorized_keys文件即可

可以打开这个文件看看

也就是rsa

公钥作为key

user@IP作为value

此时可以试验

下

从master ssh到slave已经不需要密码了

由slave反向建立也是同样

为什么要反向呢？其实如果

直都是Master启动和关闭

话那么没有必要建立反向

只是如果想在Slave也可以关闭Hadoop就需要建立反向

　　将Master上

Hadoop通过scp拷贝到每

个Slave相同

目录下

根据每

个Slave

Java_HOME

区别修改其hadoop-env.sh

　　修改Master上/etc/profile:

　　新增以下内容:(具体

内容根据你

安装路径修改

这步只是为了方便使用)

export HADOOP_HOME=/home/wenchu/hadoop-0.17.1
export PATH=$PATH:$HADOOP_HOME/bin

修改完毕后

执行source /etc/profile来使其生效

　　在Master上执行Hadoop namenode –format

这是第

需要做

化

可以看作格式化吧

以后除了在上面我提到过删除了Master上

hadoop.tmp.dir目录

否则是不需要再次执行

　　然后执行Master上

start-all.sh

这个命令可以直接执行

在6中已经添加到了path路径

这个命令是启动hdfs和mapreduce两部分

当然你也可以分开单独启动hdfs和mapreduce

分别是bin目录下

start-dfs.sh和start-mapred.sh

　　检查Master

logs目录

看看Namenode日志以及JobTracker日志是否正常启动

　　检查Slave

logs目录看看Datanode日志以及TaskTracker日志是否正常

　　如果需要关闭

那么就直接执行stop-all.sh即可

　　以上步骤就可以启动Hadoop

分布式环境

然后在Master

机器进入Master

安装目录

执行hadoop jar hadoop-0.17.1-examples.jar wordcount输入路径和输出路径

就可以看到字数统计

效果了

此处

输入路径和输出路径都指

是HDFS中

路径

因此你可以首先通过拷贝本地文件系统中

目录到HDFS中

方式来建立HDFS中

输入路径:

　　hadoop dfs -copyFromLocal /home/wenchu/test-in test-in

其中/home/wenchu/test-in是本地路径

test-in是将会建立在HDFS中

路径

执行完毕以后可以通过hadoop dfs –ls看到test-in目录已经存在

同时可以通过hadoop dfs –ls test-in查看里面

内容

输出路径要求是在HDFS中不存在

当执行完那个demo以后

就可以通过hadoop dfs –ls 输出路径看到其中

内容

具体文件

内容可以通过hadoop dfs –cat文件名称来查看

　　经验整理总结和注意事项(这部分是我在使用过程中花了

些时间走

弯路):

　　Master和Slave上

几个conf配置文件不需要全部同步

如果确定都是通过Master去启动和关闭

那么Slave机器上

配置不需要去维护

但如果希望在任意

台机器都可以启动和关闭Hadoop

那么就需要全部保持

致了

　　Master和Slave机器上

/etc/hosts中必须把集群中机器都配置上去

就算在各个配置文件中使用

是IP

这个吃过不少苦头

原来以为如果配成IP就不需要去配置Host

结果发现在执行Reduce

时候总是卡住

在拷贝

时候就无法继续下去

不断重试

另外如果集群中如果有两台机器

机器名如果重复也会出现问题

　　如果在新增了节点或者删除节点

时候出现了问题

首先就去删除Slave

hadoop.tmp.dir

然后重新启动试试看

如果还是不行那就干脆把Master

hadoop.tmp.dir删除(意味着dfs上

数据也会丢失)

如果删除了Master

hadoop.tmp.dir

那么就需要重新namenode –format

　　Map任务个数以及Reduce任务个数配置

前面分布式文件系统设计提到

个文件被放入到分布式文件系统中

会被分割成多个block放置到每

个

DataNode上

默认dfs.block.size应该是64M

也就是说如果你放置到HDFS上

数据小于64

那么将只有

个Block

此时会被放置到某

个DataNode中

这个可以通过使用命令:hadoop dfsadmin –report就可以看到各个节点存储

情况

也可以直接去某

个DataNode查看目录:hadoop.tmp.dir/dfs/data/current就可以看到那些block了

Block

数量将会直接影响到Map

个数

当然可以通过配置来设定Map和Reduce

任务个数

Map

个数通常默认和HDFS需要处理

blocks相同

也可以通过配置Map

数量或者配置minimum split size来设定

实际

个数为:max(min(block_size,data/#maps),min_split_size)

Reduce可以通过这个公式计算:0.95*num_nodes*mapred.tasktracker.tasks.maximum

　　总

来说出了问题或者启动

时候最好去看看日志

这样心里有底

　　Hadoop中

命令(Command)整理总结　　这部分内容其实可以通过命令

Help以及介绍了解

我主要侧重于介绍

下我用

比较多

几个命令

Hadoop dfs 这个命令后面加参数就是对于HDFS

操作

和Linux操作系统

命令很类似

例如:

　　Hadoop dfs –ls就是查看/usr/root目录下

内容

默认如果不填路径这就是当前用户路径；

　　Hadoop dfs –rmr xxx就是删除目录

还有很多命令看看就很容易上手；

　　Hadoop dfsadmin –report这个命令可以全局

查看DataNode

情况；

　　Hadoop job后面增加参数是对于当前运行

Job

操作

例如list,kill等；

　　Hadoop balancer就是前面提到

均衡磁盘负载

命令

　　其他就不详细介绍了

　　作者介绍:岑文初

就职于阿里软件Software公司研发中心平台

部

任架构师

当前主要工作涉及阿里软件Software开发平台服务框架(ASF)设计和实现

服务集成平台(SIP)设计和实现

没有什么擅长或者精通

工作到现在唯

提升

就是学习能力和速度

个人Blog为:http://blog.csdn.net/cenwenchu79

专注于互联网--专注于架构

首页 »Java教程 » hadoop:分布式计算开源框架Hadoop入门实战( 2) »正文

hadoop:分布式计算开源框架Hadoop入门实战( 2)

相关文章

读者评论

发表评论

热门标签

精华推荐

最新标签

Dig排行

阅读排行

最新文章