使用docker部署hadoop集群的详细教程

来自：互联网

时间：2020-09-19

阅读：

最近要在公司里搭建一个hadoop测试集群，于是采用docker来快速部署hadoop集群。

0. 写在前面

网上也已经有很多教程了，但是其中都有不少坑，在此记录一下自己安装的过程。

目标：使用docker搭建一个一主两从三台机器的hadoop2.7.7版本的集群

准备：

首先要有一台内存8G以上的centos7机器，我用的是阿里云主机。

其次将jdk和hadoop包上传到服务器中。

我安装的是hadoop2.7.7。包给大家准备好了，链接：https://pan.baidu.com/s/15n_W-1rqOd2cUzhfvbkH4g 提取码：vmzw。

1. 步骤

大致分以下几步：

安装docker
基础环境准备
配置网络，并启动docker容器
配置host及ssh免密登录
安装配置hadoop

1.1 安装docker

依次执行如下步骤安装docker。如果有docker环境的可以跳过。

yum update

yum install -y yum-utils device-mapper-persistent-data lvm2

yum-config-manager --add-repo http://mirrors.aliyun.com/docker-ce/linux/centos/docker-ce.repo

yum install -y docker-ce
 
systemctl start docker

docker -v

1.2 基础环境准备

1.2.1 创建基础的centos7镜像拉取官方centos7镜像

docker pull centos

通过build Dockfile生成带ssh功能的centos镜像

创建Dockerfile文件

vi Dockerfile

将如下内容写入Dockerfile

FROM centos
MAINTAINER mwf

RUN yum install -y openssh-server sudo
RUN sed -i 's/UsePAM yes/UsePAM no/g' /etc/ssh/sshd_config
RUN yum install -y openssh-clients

RUN echo "root:qwe123" | chpasswd
RUN echo "root  ALL=(ALL)    ALL" >> /etc/sudoers
RUN ssh-keygen -t dsa -f /etc/ssh/ssh_host_dsa_key
RUN ssh-keygen -t rsa -f /etc/ssh/ssh_host_rsa_key

RUN mkdir /var/run/sshd
EXPOSE 22
CMD ["/usr/sbin/sshd", "-D"]

上述内容大概意思是：以centos镜像为基础，设置密码为wqe123，安装ssh服务并启动

构建Dockerfile

docker build -t="centos7-ssh" .

将生成一个名为centos7-ssh的镜像，可以通过docker images查看

1.2.2 生成有hadoop和jdk环境的镜像

将准备好的包放在当前目录下。hadoop-2.7.7.tar.gz和jdk-8u202-linux-x64.tar.gz
通过build Dockfile生成带hadoop和jdk环境的centos镜像

刚才已经创建了一个Dockerfile了，先将他移开。mv Dockerfile Dockerfile.bak

创建Dockerfile

vi Dockerfile

将以下内容写入：

FROM centos7-ssh
ADD jdk-8u202-linux-x64.tar.gz /usr/local/
RUN mv /usr/local/jdk1.8.0_202 /usr/local/jdk1.8
ENV JAVA_HOME /usr/local/jdk1.8
ENV PATH $JAVA_HOME/bin:$PATH

ADD hadoop-2.7.7.tar.gz /usr/local
RUN mv /usr/local/hadoop-2.7.7 /usr/local/hadoop
ENV HADOOP_HOME /usr/local/hadoop
ENV PATH $HADOOP_HOME/bin:$PATH

RUN yum install -y which sudo

上述内容大概意思是：以上面生成的centos7-ssh为基础，将hadoop和jdk包放进去，然后配好环境变量。

构建Dockerfile

docker build -t="hadoop" .

将生成一个名为hadoop的镜像

1.3 配置网络，并启动docker容器

因为集群间必须要能网络连通，所以要先配置好网络。

创建网络

docker network create --driver bridge hadoop-br

以上命令创建了一个名为hadoop-br的bridge类型的网络

启动docker时指定网络

docker run -itd --network hadoop-br --name hadoop1 -p 50070:50070 -p 8088:8088 hadoop
docker run -itd --network hadoop-br --name hadoop2 hadoop
docker run -itd --network hadoop-br --name hadoop3 hadoop

以上命令启动了3台机器，网络都指定为hadoop-br，hadoop1还开启了端口映射。

查看网络情况

docker network inspect hadoop-br

执行以上命令就可以看到对应的网络信息：

[
  {
    "Name": "hadoop-br",
    "Id": "88b7839f412a140462b87a353769e8091e92b5451c47b5c6e7b44a1879bc7c9a",
    "Containers": {
"86e52eb15351114d45fdad4462cc2050c05202554849bedb8702822945268631": {
        "Name": "hadoop1",
        "IPv4Address": "172.18.0.2/16",
        "IPv6Address": ""
      },
      "9baa1ff183f557f180da2b7af8366759a0d70834f43d6b60fba2e64f340e0558": {
        "Name": "hadoop2",
        "IPv4Address": "172.18.0.3/16",
        "IPv6Address": ""
      }, "e18a3166e965a81d28b4fe5168d1f0c3df1cb9f7e0cbe0673864779b224c8a7f": {
        "Name": "hadoop3",
        "IPv4Address": "172.18.0.4/16",
        "IPv6Address": ""
      }
    },
  }
]

我们可以得知3台机器对应的ip：

172.18.0.2 hadoop1 
172.18.0.3 hadoop2 
172.18.0.4 hadoop3

登录docker容器，互相之间就可以ping通了。

docker exec -it hadoop1 bash
docker exec -it hadoop2 bash
docker exec -it hadoop3 bash

1.4 配置host及ssh免密登录

1.4.1 配置host

分别在每台修改每台机器的host

vi /etc/hosts

将以下内容写入（注：docker分出来的ip对于每个人可能不一样，填你自己的）：

172.18.0.2 hadoop1 
172.18.0.3 hadoop2 
172.18.0.4 hadoop3

1.4.2 ssh免密登录

因为上面在镜像中已经安装了ssh服务，所以直接分别在每台机器上执行以下命令：

ssh-keygen
一路回车
ssh-copy-id -i /root/.ssh/id_rsa -p 22 root@hadoop1
输入密码，如果按我的来得话就是qwe123
ssh-copy-id -i /root/.ssh/id_rsa -p 22 root@hadoop2
输入密码，如果按我的来得话就是qwe123
ssh-copy-id -i /root/.ssh/id_rsa -p 22 root@hadoop3
输入密码，如果按我的来得话就是qwe123

1.4.3 测试是否配置成功

ping hadoop1 
ping hadoop2
ping hadoop3
ssh hadoop1
ssh hadoop2
ssh hadoop3

1.5 安装配置hadoop

1.5.1 在hadoop1上操作

进入hadoop1

docker exec -it hadoop1 bash

创建一些文件夹，一会在配置中要用到

mkdir /home/hadoop
mkdir /home/hadoop/tmp /home/hadoop/hdfs_name /home/hadoop/hdfs_data

切换到hadoop配置的目录

cd $HADOOP_HOME/etc/hadoop/

编辑core-site.xml

<property>
    <name>fs.defaultFS</name>
    <value>hdfs://hadoop1:9000</value>
  </property>
  <property>
    <name>hadoop.tmp.dir</name>
    <value>file:/home/hadoop/tmp</value>
  </property>
  <property>
    <name>io.file.buffer.size</name>
    <value>131702</value>
  </property>

编辑hdfs-site.xml

 <property>
    <name>dfs.namenode.name.dir</name>
    <value>file:/home/hadoop/hdfs_name</value>
  </property>
  <property>
    <name>dfs.datanode.data.dir</name>
    <value>file:/home/hadoop/hdfs_data</value>
  </property>
  <property>
    <name>dfs.replication</name>
    <value>2</value>
  </property>
  <property>
    <name>dfs.namenode.secondary.http-address</name>
    <value>hadoop1:9001</value>
  </property>
  <property>
    <name>dfs.webhdfs.enabled</name>
    <value>true</value>
  </property>

编辑mapred-site.xml

mapred-site.xml默认不存在，要执行cp mapred-site.xml.template mapred-site.xml

 <property>
    <name>mapreduce.framework.name</name>
    <value>yarn</value>
  </property>
  <property>
    <name>mapreduce.jobhistory.address</name>
    <value>hadoop1:10020</value>
  </property>
  <property>
    <name>mapreduce.jobhistory.webapp.address</name>
    <value>hadoop1:19888</value>
  </property>

编辑yarn-site.xml

 <property>
    <name>yarn.nodemanager.aux-services</name>
    <value>mapreduce_shuffle</value>
  </property>
  <property>
    <name>yarn.nodemanager.auxservices.mapreduce.shuffle.class</name>
    <value>org.apache.hadoop.mapred.ShuffleHandler</value>
  </property>
  <property>
    <name>yarn.resourcemanager.address</name>
    <value>hadoop1:8032</value>
  </property>
  <property>
    <name>yarn.resourcemanager.scheduler.address</name>
    <value>hadoop1:8030</value>
  </property>
  <property>
    <name>yarn.resourcemanager.resource-tracker.address</name>
    <value>hadoop1:8031</value>
  </property>
  <property>
    <name>yarn.resourcemanager.admin.address</name>
    <value>hadoop1:8033</value>
  </property>
  <property>
    <name>yarn.resourcemanager.webapp.address</name>
    <value>hadoop1:8088</value>
  </property>

编辑slaves

我这里把hadoop1当成主节点，hadoop2、3作为从节点

hadoop2
hadoop3

把文件拷贝到hadoop2和hadoop3上

依次执行以下命令：

scp -r $HADOOP_HOME/ hadoop2:/usr/local/
scp -r $HADOOP_HOME/ hadoop3:/usr/local/

scp -r /home/hadoop hadoop2:/
scp -r /home/hadoop hadoop3:/

1.5.2 在每台机器上操作

分别连接每台机器

docker exec -it hadoop1 bash
docker exec -it hadoop2 bash
docker exec -it hadoop3 bash

配置hadoop sbin目录的环境变量

因为hadoop bin目录在之前创建镜像时就配好了，但是sbin目录没有配，所以要单独配置。分配为每台机器配置：

vi ~/.bashrc

追加如下内容：

export PATH=$PATH:$HADOOP_HOME/sbin

执行：

source ~/.bashrc

1.5.3 启动hadoop

在hadoop1上执行以下命令：

格式化hdfs

hdfs namenode -format

一键启动

start-all.sh

不出错的话，就可以庆祝一下了。出错的话，加油。

1.6 测试使用hadoopjps

# hadoop1
1748 Jps
490 NameNode
846 ResourceManager
686 SecondaryNameNode

# hadoop2
400 DataNode
721 Jps
509 NodeManager

# hadoop3
425 NodeManager
316 DataNode
591 Jps

上传文件

hdfs dfs -mkdir /mwf

echo hello > a.txt
hdfs dfs -put a.txt /mwf

hdfs dfs -ls /mwf

Found 1 items
drwxr-xr-x  - root supergroup     0 2020-09-04 11:14 /mwf

由于是云服务器，不想配端口，就不看ui界面了。

2. 最后

以上是我安装成功之后总结的过程，应该没有问题，也可能有遗漏。

3. 参考

https://cloud.tencent.com/developer/article/1084166

https://cloud.tencent.com/developer/article/1084157?from=10680

https://blog.csdn.net/ifenggege/article/details/108396249

服务器是企业和个人重要的存储设备之一，而数据是企业和个人的珍贵财富，一旦服务器出现故障，会导致数据丢失或者受损，对公司或个人造成巨大的损失。因此，服务器备份和恢复数据备受

2024-10-21 20:49:48

目录一：证书配置二：Tomcat配置 http自动跳转 https 总结一：证书配置下载已签发的证书、选择 Tomcat 版本进入 Tomcat 目录创建个 cert 文件夹将下载好的 SSL证书压缩包里的

2024-10-20 21:52:57

目录一、引言二、基本概念三、修改密码的步骤 3.1 登录到 CentOS 服务器 3.2 修改当前用户的密码 3.3 修改其他用户的密码 3.4 密码复杂性检查四、解决密码复杂性

2024-10-20 21:52:48

目录引言 1. Nginx简介 2. 跨域问题简介 3. 解决跨域问题的方法步骤一：安装和配置Nginx 步骤二：测试跨域访问结论总结引言在现代的Web开发中，跨域访问是一种常见的

2024-10-18 23:19:22

目录方法 1：直接从服务器上抓取并查看证书方法 2：通过 openssl 抓取并查看证书方法 3：下载并查看证书文件证书信息解析总结查看服务器端的证书时，可以通过导入服务器

2024-10-18 23:19:14

目录一、找到位于 /etc/netplan 的 netplan 目录二、修改或创建配置文件三、配置与本机相符的网络适配器四、禁用DHCP 五、配置静态IP、子网掩码、网关六、配置DNS服务

2024-10-18 23:19:06

目录方法一第一步：查看当前主机网络信息第二步：修改配置文件进入配置文件夹第三步：使配置生效且检查网络连接状况方法二第一步：查看当前主机网络信息第二步：修改

2024-10-18 23:18:57

目录 LINUX使用rsync命令 Rsync 命令语法 Rsync 命令选项 Rsync 命令命令示例 Rsync命令的基本语法使用 Rsync 命令传输文件和目录使用 Rsync 命令镜像数据

2024-10-18 23:18:22

目录首先重来就没有设置过ROOT用户 1.使用普通用户登录后输入以下命 2.设置root用户密码 3.输入“su”切换为root用户登录 4.输入“Visudo”命令

2024-10-18 23:18:14

目录 Linux解决「Unknown filesystem」遇到这种情况应该如何修复总结Linux解决「Unknown filesystem」不知道大家在使用 Linux 系统的时候有没有遇见过「Unknown filesys

2024-10-18 23:18:02

目录下载nginx 配置启动总结下载nginx下载地址https://nginx.org/en/download.htmldownload > Stable version 可选择稳定版的nginxnginx压缩包解压后的目录配置1.将打

2024-10-18 23:17:53

目录 1、VScode扩展安装与配置（1）vscode扩展安装（2）vscode远程配置 2、vscode-server离线下载（1）Commit ID查看（2）安装包下载 3、文件解压缩 4、移动文件到指定位置

2024-10-18 23:17:27

目录 Linux中监控系统重启的重要性深入探究：Linux 重启日志使用last命令 uptime 命令利用journalctl获取重启历史记录 who -b 命令总结借其强大的架构和无与伦比的灵活性

2024-10-18 23:17:06

目录 MKDIR 命令的语法 mkdir 命令可用的选项深入了解 MKDIR 命令示例使用 mkdir 创建简单目录在以其绝对功能和灵活性而闻名的 Linux 操作系统的动态世界中，有大量

2024-10-18 23:16:52

目录如何通过 Nginx 只允许 www 域名访问并禁止裸域名访问步骤 1：配置 Nginx 处理 www 域名步骤 2：禁止裸域名访问步骤 3：重定向裸域名到 www 域名（可选）步骤 4：重启 Ng

2024-10-18 23:16:32

从日志信息来看，确实是权限问题（Permission denied）。我们可以重新检查并设置权限，确保 Nginx 用户有权限访问这些文件。检查 Nginx 用户：首先确认 Nginx 使用的用户，一般是 www-d

2024-10-14 19:52:38

目录一、telnet简述二、telnet Connection refused不通处理思路一般对应上面的后两种情况排查目的主机服务总结一、telnet简述telnet一般用于测试本机到目的主机

2024-10-14 19:52:29

目录在linux下图形界面和命令行界面的切换 1. 图形界面和命令行界面的切换 2. 修改系统开机进入的界面总结在linux下图形界面和命令行界面的切换我估计好多喜欢用li

2024-10-14 19:52:19

目录 telnet nc命令返回“连接失败” 1、端口没有被监听 2、防火墙策略 3、目标主机不接受外部连接总结 telnet nc命令返回“连接失败”当使用n

2024-10-14 19:52:12

目录 1、问题描述 2、问题解决1、问题描述在命令行输入命令按Tab键时出现如下报错：很明显，设备上没有空间，即磁盘空间不足。通过命令查看具体情况如下：df -h2、问题解决首先想到

2024-10-14 19:52:02

本文主要介绍了nginx配置history模式的使用小结，具体如下：worker_processes 1; events { worker_connections 1024;} http { include mime.types; default_t

2024-10-14 19:51:41

目录一、配置 Nginx 获取客户端真实 IP 1、基本配置说明 2、set_real_ip_from详解 3、log_format 配置（参考）二、调试与测试三、Lua 中使用客户端真实 IP（参考）四

2024-10-14 19:51:32

目录官方文档代理样例 Linux 查看安装文件命令手册 Nginx 日志配置方案成功解决问题–使用 Nginx 代理 WebSocket 可能出现的问题 Nginx 官方文档网址 nginx d

2024-10-14 19:50:51

目录方法1: 使用 netstat 命令方法2: 使用 lsof 命令方法3: 使用 ss 命令方法4: 直接从Java进程读取注意事项在Linux系统中，如果你已经知道了Java应用程序的进程ID（PID），你

2024-10-14 19:50:44

目录 logrotate 简介 logrotate 配置文件日志回滚原理 sshd 日志回滚实战修改配置文件重启rsyslog 强制切割测试和运行 logrotate debug 模式 v

2024-10-14 19:50:35

目录利用Linux自带的logrotate管理日志 1. logrotate简介 2. logrotate配置参数 3. nginx日志切割实例 4. 其他配置示例总结利用Linux自带的logrotate管理日志日

2024-10-14 19:50:22

是一种常见的命令行工具，用于从远程服务器下载整个目录及其子目录中的文件。它可以通过递归方式下载目录中的所有文件，并保持目录结构的完整性。wget是一个开源的非交互式命令

2024-10-14 14:17:31

目录 linux开启关闭防火墙 1.关闭防火墙 2.设置开机不启动 3.查看防火墙状态不同系统常见防火墙相关命令下面是red hat/CentOs7关闭防火墙的命令 firewalld 总结

2024-10-12 00:18:20

目录第一种：Nginx自己的错误页面第二种：反向代理的错误页面一个网站项目，肯定是避免不了404页面的，通常使用Nginx作为Web服务器时，有以下集中配置方式，一起来看看。第一种：Nginx

2024-09-30 00:10:50

目录问题原因解决方法 1. 查看 Nginx 错误日志 2. 检查 Nginx 配置文件 3. 检查应用程序日志 4. 检查文件权限 5. 检查后端服务示例 Nginx 配置检查步骤检查步

2024-09-30 00:09:29

我从2017年做Vulhub开始，一直在和一个麻烦的问题做斗争：在编写Dockerfile的时候，如何减小 docker build 生成的镜像大小？这篇文章就给大家总结一下我自己使用过的六种减小镜像

2020-09-19 00:19:39

Docker映射端口时仅有IPv6无法到IPv4启动 docker 某服务，只显示 ipv6 的端口信息。ipv4 无端口信息，导致外部无法通过 ipv4 访问服务，报 Connection refused 错误解决方法在服

2020-09-19 00:17:55

Docker 安装 NginxNginx 是一个高性能的 HTTP 和反向代理 web 服务器，同时也提供了 IMAP/POP3/SMTP 服务。1、查看可用的 Nginx 版本访问 Nginx 镜像库地址： https://hub.doc

2020-09-19 00:15:58

拉取镜像docker pull mysql查看拉取完成的镜像docker images通过镜像创建并启动一个MySQL容器docker run --name mysql_dev -e MYSQL_ROOT_PASSWORD=123456 -p 3333:3306 -d

2020-09-19 00:14:45

dockerfile 是用来构建docker镜像的文件！命令参数脚本！构建步骤：编写一个dockerfile 文件 docker build 构建成一个镜像 docker run 运行镜像 docker push 发布镜像（DockerHub

2020-09-19 00:11:35

Docker ComposeCompose 简介Compose 是用于定义和运行多容器 Docker 应用程序的工具。通过 Compose，您可以使用 YML 文件来配置应用程序需要的所有服务。然后，使用一个命令，就

2020-09-19 00:02:36

具体安装步骤如下：实测版本说明 centos：7.5 docker：19.03.5 docker-compose：1.24.3官方资源下载地址自行下载需要的版本。[docker](https://download.docker.com/linux/stati

2020-09-18 21:06:40

这篇文章主要介绍了Docker批量容器编排的实现，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧"

2020-09-16 23:53:02

单节点数据库的弊病大型互联网程序用户群体庞大,所以架构必须要特殊设计单节点的数据库无法满足性能上的要求单节点的数据库没有冗余设计,无法满足高可用单节点MySQL的性

2020-09-16 23:47:59

这篇文章主要介绍了deepin apt命令安装最新版本的docker的方法，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧

2020-09-16 23:44:07

2020-07-31

2019-11-21

2019-08-07

2018-09-24

2020-03-22

2019-02-16

2019-11-17

2018-10-07

2018-10-04

使用docker部署hadoop集群的详细教程

热点内容

免费资源网

在线工具

扫一扫随时看

本站下载频道