linux怎么安装hadoop

linux怎么安装hadoop,第1张

在Linux上安装Hadoop之前,需要先安装两个程序:1. JDK 1.6或更高版本

2. SSH(安全外壳协议),推荐安装OpenSSH。

下面简述一下安装这两个程序的原因:

1. Hadoop是用Java开发的,Hadoop的编译及MapReduce的运行都需要使用JDK。

2. Hadoop需要通过SSH来启动salve列表中各台主机的守护进程,因此SSH也是必须安装的,即使是安装伪分布式版本(因为Hadoop并没有区分集群式和伪分布式)。对于伪分布式,Hadoop会采用与集群相同的处理方式,即依次序启动文件conf/slaves中记载的主机上的进程,只不过伪分布式中salve为localhost(即为自身),所以对于伪分布式Hadoop,SSH一样是必须的。

一、安装JDK 1.6

安装JDK的过程很简单,下面以Ubuntu为例。

(1)下载和安装JDK

确保可以连接到互联网,输入命令:

sudo apt-get install sun-java6-jdk

输入密码,确认,然后就可以安装JDK了。

这里先解释一下sudo与apt这两个命令,sudo这个命令允许普通用户执行某些或全部需要root权限命令,它提供了详尽的日志,可以记录下每个用户使用这个命令做了些什么 *** 作同时sudo也提供了灵活的管理方式,可以限制用户使用命令。sudo的配置文件为/etc/sudoers。

apt的全称为the Advanced Packaging Tool,是Debian计划的一部分,是Ubuntu的软件包管理软件,通过apt安装软件无须考虑软件的依赖关系,可以直接安装所需要的软件,apt会自动下载有依赖关系的包,并按顺序安装,在Ubuntu中安装有apt的一个图形化界面程序synaptic(中文译名为“新立得”),大家如果有兴趣也可以使用这个程序来安装所需要的软件。(如果大家想了解更多,可以查看一下关于Debian计划的资料。)

一、安装hadoop

1 因为hadoop是基于java的,所以要保证hadoop能找到在本地系统中大路径,即正确设置java的环境变量。

详细请看:linux 安装配置jdk

2 到官网:http://www.apache.org/dyn/closer.cgi/hadoop/common/ 下载hadoop,

这里我选择hadoop1.0.4

3 解压到 /usr/local

tar -xvf hadoop-1.0.4.tar.gz

4 设置hadoop环境变量,为了使环境变量永久有效并对所有用户有效,我们将下面两句添加到/etc/profile

export HADOOP_HOME=/usr/local/hadoop-1.0.4

export PATH=$PATH:$HADOOP_HOME/bin

5 验证hadoop是否可以运行

hadoop version

ok, 安装成功!(?不算安装吧,哈哈)

二、配置伪分布式模式

根据上面步骤安装成功后,hadoop处于独立模式即本机模式,在本机模式下,没有运行守护进程,所有程序运行在单个JVM上。本机模式用于开发阶段测试调试MapReduce程序。伪分布模式用于在本机上模拟一个小规模的集群,全分布模式配置较为复杂,留作后面的文章。

1 配置hadoop

(1) 修改core-site.xml,设置namenode主机及hadoop文件系统

<configuration>

<property>

<name>fs.default.name</name>

<value>hdfs://localhost:9001</value>

</property>

</configuration>

(2) 修改hdfs-site.xml,设置数据块副本数目

<configuration>

<property>

<name>dfs.replication</name>

<value>1</value>

</property>

</configuration>

(3) 修改mapred-site.xml,设置jobtracker主机及端口

<configuration>

<property>

<name>mapred.job.tracker</name>

<value>hdfs://localhost:9000</value>

</property>

</configuration>

(4)修改hadoop-env.sh,设置JAVA_HOME

在hadoop-env.sh中添加,本机中jdk路径

export JAVA_HOME=/usr/local/jdk1.7.0

2 配置SSH

(1)如果没有安装SSH,安装之:sudo apt-get install ssh

一般情况下,ubuntu默认安装openssh-client,但没有安装server,我们需要先安装server:

sudo apt-get install openssh-server

(2)基于空口令创建一个新的SSH密钥,启用无密码登录

ssh-keygen -t rsa -P '' -f ~/.ssh/id_rsa

cat ~/.ssh/id_rsa.pub >>~/.ssh/authorized_keys

(3)测试连接是否成功:

ssh localhost

3 格式化HDFS文件系统以创建一个空大文件系统

hadoop namenode -format

4 启动守护系统HDFS和MapReduce

start-dfs.sh

start-mapred.sh

5 查看守护进程启动情况

jps

如果显示:

10716 DataNode

11305 Jps

10938 SecondaryNameNode

10503 NameNode

11037 JobTracker

11251 TaskTracker

ok, hadoop伪分布模式配置成功!


欢迎分享,转载请注明来源:内存溢出

原文地址:https://54852.com/yw/7535818.html

(0)
打赏 微信扫一扫微信扫一扫 支付宝扫一扫支付宝扫一扫
上一篇 2023-04-06
下一篇2023-04-06

发表评论

登录后才能评论

评论列表(0条)

    保存