使用IDEA搭建Hadoop开发环境的操作步骤(Window10为例)

来自：网络

时间：2021-08-09

阅读：

下载安装Hadoop

下载安装包

进入官网下载下载hadoop的安装包（二进制文件）http://hadoop.apache.org/releases.html

我们这里下载2.10.1版本的，如果想下载更高版本的请先去maven仓库查看是否有对应版本

解压文件

下载好的.gz文件可以直接解压。

winRAR和Bandizip都可以用来解压，但是注意必须以管理员身份打开解压软件，否则会出现解压错误

配置环境变量

配置JAVA_HOME和HADOOP_HOME

我们在环境变量处分别设置JAVA_HOME和HADOOP_HOME

然后在Path里添加JAVA和hadoop的二进制文件夹，bin文件夹

验证环境变量配置

打开你的cmd，输入以下命令，出现我这样的输出说明配置环境变量成功：

C:\Users\lenovo>hadoop -version

HDFS配置

来到之前解压的hadoop文件夹下，打开etc/hadoop文件夹

现在我们的任务就是修改这些文件当中的代码，务必修改，不然根本无法运行hadoop！！

修改 hadoop-env.cmd

将configuration处更改为：

<configuration>
   <property>
     <name>fs.defaultFS</name>
     <value>hdfs://0.0.0.0:9000</value>
   </property>
</configuration>

修改 hdfs-site.xml

将configuration处更改为如下所示，其中
file:///E:/DevTols/hadoop-2.10.1/namespace_logs
file:///E:/DevTols/hadoop-2.10.1/data
这两个文件夹一定需要是已经存在的文件夹，你可以在你的hadoop文件夹下随意创建两个文件夹，然后将下面的这两个文件夹的绝对路径替换成你的文件夹，这里我也是创建了两个新的文件夹，hadoop的下载文件夹里本身是没有的。

将configuration标签及内容替换为

<configuration>
   <property>
     <name>dfs.replication</name>
     <value>1</value>
   </property>
   <property>
     <name>dfs.name.dir</name>
     <value>file:///E:/DevTols/hadoop-2.10.1/namespace_logs</value>
   </property>
   <property>
     <name>dfs.data.dir</name>
     <value>file:///E:/DevTols/hadoop-2.10.1/data</value>
   </property>
</configuration>

修改 mapred-site.xml

将下方的%USERNAME%替换成你windows的用户名
用户名可以通过win键查看

<configuration>
   <property>
      <name>mapreduce.job.user.name</name>
      <value>%USERNAME%</value>
    </property>
   <property>
      <name>mapreduce.framework.name</name>
      <value>yarn</value>
    </property>
  <property>
     <name>yarn.apps.stagingDir</name>
     <value>/user/%USERNAME%/staging</value>
   </property>
  <property>
     <name>mapreduce.jobtracker.address</name>
     <value>local</value>
   </property>
</configuration>

注意以上代码有两个地方的%USERNAME%需要替换，不要漏了！！！

修改 yarn-site.xml

<configuration>
   <property>
     <name>yarn.server.resourcemanager.address</name>
     <value>0.0.0.0:8020</value>
   </property>
  <property>
     <name>yarn.server.resourcemanager.application.expiry.interval</name>
     <value>60000</value>
   </property>
  <property>
     <name>yarn.server.nodemanager.address</name>
     <value>0.0.0.0:45454</value>
   </property>
  <property>
     <name>yarn.nodemanager.aux-services</name>
     <value>mapreduce_shuffle</value>
   </property>
  <property>
     <name>yarn.nodemanager.aux-services.mapreduce.shuffle.class</name>
     <value>org.apache.hadoop.mapred.ShuffleHandler</value>
   </property>
  <property>
     <name>yarn.server.nodemanager.remote-app-log-dir</name>
     <value>/app-logs</value>
   </property>
  <property>
     <name>yarn.nodemanager.log-dirs</name>
     <value>/dep/logs/userlogs</value>
   </property>
  <property>
     <name>yarn.server.mapreduce-appmanager.attempt-listener.bindAddress</name>
     <value>0.0.0.0</value>
   </property>
  <property>
     <name>yarn.server.mapreduce-appmanager.client-service.bindAddress</name>
     <value>0.0.0.0</value>
   </property>
  <property>
     <name>yarn.log-aggregation-enable</name>
     <value>true</value>
   </property>
  <property>
     <name>yarn.log-aggregation.retain-seconds</name>
     <value>-1</value>
   </property>
  <property>
     <name>yarn.application.classpath</name>
     <value>%HADOOP_CONF_DIR%,%HADOOP_COMMON_HOME%/share/hadoop/common/*,%HADOOP_COMMON_HOME%/share/hadoop/common/lib/*,%HADOOP_HDFS_HOME%/share/hadoop/hdfs/*,%HADOOP_HDFS_HOME%/share/hadoop/hdfs/lib/*,%HADOOP_MAPRED_HOME%/share/hadoop/mapreduce/*,%HADOOP_MAPRED_HOME%/share/hadoop/mapreduce/lib/*,%HADOOP_YARN_HOME%/share/hadoop/yarn/*,%HADOOP_YARN_HOME%/share/hadoop/yarn/lib/*</value>
   </property>
</configuration>

初始化环境变量

在windows下的cmd，输入cmd的命令，用于初始化环境变量。

%HADOOP_HOME%\etc\hadoop\hadoop-env.cmd

格式化文件系统

这个命令在整个hadoop的配置环境和之后的使用当中务必仅使用一次！
将如下的命令输入到cmd当中进行格式化：

hadoop namenode -format

会弹出一大堆指令，只要看到其中有如下提示，就说明格式化成功

INFO common.Storage: Storage directory E:\DevTols\hadoop-2.10.1\namespace_logs has been successfully formatted.

向hadoop文件当中注入winutills文件

由于windows下想要开启集群，会有一定的bug，因此我们去网站：https://github.com/steveloughran/winutils
下载对应版本的winutils.exe文件。打开这个Github仓库后如下所示：

我们打开hadoop2.8.3/bin，选择其中的winutils.exe文件进行下载，然后将下载的这个文件放入到本地的hadoop/bin文件当中。不然的话，你打开一会儿你的伪分布式集群，马上hadoop就会自动关闭，缺少这两个文件的话。

向hadoop文件当中添加hadoop.dll文件

hadoop.dll文件是启动集群时必须的，如果在安装过程中悲催地发现/bin目录下没有该文件（比如博主），就需要去网上自学下载该文件。
进入网页https://github.com/4ttty/winutils，
根据箭头所指步骤下载hadoop.dll文件

下载完成后，把文件添加到/bin目录

开启hadoop集群

在cmd当中输入

%HADOOP_HOME%/sbin/start-all.cmd

这样就会跳出来很多黑色的窗口，如下所示：

然后可以使用JPS工具查看目前开启的node有哪些，如果出现namenode，datanode的话说明集群基本上就成功了。如下所示：

打开本地浏览器进行验证

我们在浏览器输入localhost:50070,如果能够打开这样的网页，说明hadoop已经成功开启：

IDEA 配置

历经千辛万苦我们总算安装完Hadoop了，下面在IDEA上用maven配置hadoop

创建MAVEN项目工程

打开IDEA之后，里面的参数和项目工程名称随便写，等待工程创建完毕即可。然后我们编辑pom.xml文件

<?xml version="1.0" encoding="UTF-8"?>
<project xmlns="http://maven.apache.org/POM/4.0.0"
         xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
         xsi:schemaLocation="http://maven.apache.org/POM/4.0.0 http://maven.apache.org/xsd/maven-4.0.0.xsd">
    <modelVersion>4.0.0</modelVersion>

    <groupId>com.atguigu</groupId>
    <artifactId>hdfs1205</artifactId>
    <version>1.0-SNAPSHOT</version>

    <properties>
        <maven.compiler.source>8</maven.compiler.source>
        <maven.compiler.target>8</maven.compiler.target>
    </properties>
    <dependencies>
        <dependency>
            <groupId>junit</groupId>
            <artifactId>junit</artifactId>
            <version>RELEASE</version>
        </dependency>
        <dependency>
            <groupId>org.apache.logging.log4j</groupId>
            <artifactId>log4j-core</artifactId>
            <version>2.8.2</version>
        </dependency>
        <dependency>
            <groupId>org.apache.hadoop</groupId>
            <artifactId>hadoop-common</artifactId>
            <version>2.10.1</version>
        </dependency>
        <dependency>
            <groupId>org.apache.hadoop</groupId>
            <artifactId>hadoop-client</artifactId>
            <version>2.10.1</version>
        </dependency>
        <dependency>
            <groupId>org.apache.hadoop</groupId>
            <artifactId>hadoop-hdfs</artifactId>
            <version>2.10.1</version>
        </dependency>
    </dependencies>

</project>

点击右下方的auto-import，自动安装jar包。完成后左侧External Libraries可以看到添加了很多个jar包，如下图

这样就说明我们导入maven仓库成功了。

编写log4j.proporties配置文件

在src/main/resources目录下创建log4j.proporties文件，编写如下代码

log4j.rootLogger=debug, stdout, R

log4j.appender.stdout=org.apache.log4j.ConsoleAppender
log4j.appender.stdout.layout=org.apache.log4j.PatternLayout

# Pattern to output the caller's file name and line number.
log4j.appender.stdout.layout.ConversionPattern=%5p [%t] (%F:%L) - %m%n

log4j.appender.R=org.apache.log4j.RollingFileAppender
log4j.appender.R.File=example.log

log4j.appender.R.MaxFileSize=100KB
# Keep one backup file
log4j.appender.R.MaxBackupIndex=5

log4j.appender.R.layout=org.apache.log4j.PatternLayout
log4j.appender.R.layout.ConversionPattern=%p %t %c - %m%n

编写Java文件

终于到最后一步了，编写java文件并执行
别忘了先hadoop伪分布式集群！！！
cmd中编写%HADOOP_HOME%/sbin/start-all.cmd

import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.FileStatus;
import org.apache.hadoop.fs.FileSystem;
import org.apache.hadoop.fs.Path;

import java.net.URI;

public class Test {
    public static void main(String[] args) throws Exception {
        FileSystem fs = FileSystem.get(new URI("hdfs://127.0.0.1:9000"), new Configuration());

        FileStatus[] files = fs.listStatus(new Path("/"));
        for (FileStatus f : files) {
            System.out.println(f);
        }
        System.out.println("Compile Over");
    }
}

这段代码的含义是遍历hadoop文件系统(HDFS)下的root下所有文件的状态，并输出

完成以后在cmd输入%HADOOP_HOME%/sbin/start-all.cmd关闭伪集群

为了方便可以配置%HADOOP_HOME%/sbin/start-all.cmd和%HADOOP_HOME%/sbin/start-all.cmd
的环境变量，这里不再赘述，留给读者发挥。

到这里Window10下使用IDEA搭建开发环境就完成了，撒花！！！

目录 mybatis resultType自带数据类型别名定义了一些常见类的别名整理成表格总结 mybatis resultType自带数据类型别名为了简化开发，mybatis 默认在 org.apache.ibat

2024-10-20 21:52:35

目录 1. 引言 2. 核心代码解析 2.1 POM依赖 2.2 SpringBoot启动类注解 2.3 核心代码总结 3. Spring 注解说明 3.1 @Retryable注解 3.2 @Backoff注解 4. 如何使用

2024-10-20 21:52:26

目录 Spring Boot API 中的速率限制步骤 1 - 定义速率限制配置步骤 2 - 创建速率限制方面步骤 3 — 定义 RateLimited 注释步骤 4 - 实施速率限制器步骤 5

2024-10-20 21:52:18

目录引言 1. 使用 Spring Boot 默认的 Logback 日志框架步骤： 2. 使用 Log4j2 日志框架步骤： 3. 在代码中使用日志 4.使用lombok.extern.slf4j.Slf4j 1.基本使用

2024-10-20 21:52:11

目录前言 1.方法一：反射获取线程池中的线程列表 2.方法二：使用Thread.getAllStackTraces() 3.方法三：使用ThreadPoolExecutor的getCompletedTaskCount()和getActiveCount()等

2024-10-20 21:52:03

目录一、使用 @Scheduled 注解二、使用 SchedulingConfigurer 接口三、使用 TaskScheduler 四、使用 Quartz 实现定时任务一、使用 @Scheduled 注解@Scheduled 是 Spring

2024-10-20 21:51:49

目录引言一、问题描述： 1.1 报错示例： 1.2 报错分析： 1.3 解决思路：二、解决方法： 2.1 方法一： 2.2 方法二： 2.3 方法三： 2.4 方法四：三、其他解决方法：四、总结：

2024-10-20 21:51:41

目录 SpringBoot项目启动报错：命令行太长解决 1. 第一种方法 1. 第二种方法 1-1 旧版本Idea 1-2 新版本Idea SpringBoot项目启动报错：命令行太长解决报错信息：1. 第

2024-10-20 21:51:32

目录前言一、Spring Boot 日志框架概述 1.1 Spring Boot 支持的日志框架 1.2 Spring Boot 默认日志配置二、日志框架冲突问题 2.1 问题描述 2.2 解决方案 2.3 检

2024-10-20 21:51:18

目录前言一、Maven 简介二、为什么需要手动添加 JAR 文件？三、Maven 本地仓库位置如何确认本地仓库位置？四、创建必要的目录结构创建目录结构的步骤：五、创建 PO

2024-10-20 21:51:10

目录什么是职责链模式？职责链模式在电商订单流程中的应用 POM 文件配置具体处理器实现控制器接口优化前端界面及 jQuery 调用 JSON 接口总结在电商系统中，订单的处理流

2024-10-18 23:26:01

目录 1.生成war包 1.1 更改pom包 1.2 编写类 1.3 将war包使用 tomcat 解压为文件夹 1.生成war包1.1 更改pom包打开一个springboot 项目，右击项目名从项目管理器打开在po

2024-10-18 23:25:45

数据库表中的字段创建时间 (createTime) 更新时间 (updateTime)每次增删改查的时候，需要通过对Entity的字段（createTime，updateTime）进行set设置，但是，每次增删改都要set设置比

2024-10-18 23:25:25

目录主键策略 1、AUTO(自动增长策略) 2、INPUT(插入前自行设置主键值) 3、ASSING_ID(雪花算法) 4、ASSING_UUID(不含中划线的UUID) 5、NONE(无状态) 雪花算法算

2024-10-18 23:25:12

目录第一个Hystrix程序步骤1：创建父工程hystrix-1 步骤2：改造服务提供者步骤3：改造服务消费者为Hystrix客户端（1）添加Hystrix依赖（2）添加@EnableHystrix注解（3）创

2024-10-18 23:24:58

目录 Config与Bus整合自动刷新步骤1：安装RabbitMQ并启动 RabbitMQ的安装步骤2：创建项目创建Eureka Server 创建config-server 步骤3：添加依赖修改配置文件步骤4：Co

2024-10-18 23:24:27

目录 1. 前言 2. 注册 2.1. 手机验证码注册流程 2.2. 代码实现（仅核心） 3. 登录 3.1. 手机验证码登录流程 3.2. 涉及到的Spring Security组件 3.3. 代码实现（仅核心）

2024-10-18 23:23:50

目录 Java中重写和重载的区别方法重载的规则方法重写的规则总结 Java中重写和重载的区别其实java中的重写和重载没有任何关系，只是因为都有个重字，有些小白就会对这两

2024-10-18 23:23:37

目录 1. 什么是 Spring Web MVC 1.1 MVC 定义 1.2 什么是 Spring MVC 2. 学习 Spring MVC 2.1 项目准备 2.2 建立连接 1. 什么是 Spring Web MVCSpring Web MVC 是基

2024-10-18 23:23:29

目录 springBoot跨域注解@CrossOrigin用法在controller控制类上方加注解 spring注解@CrossOrigin不起作用的原因总结 springBoot跨域注解@CrossOrigin用法Spring Fra

2024-10-18 23:23:14

目录 1. 找到自动生成的pom.xml文件 2.添加servlet依赖 3.别眨眼，你已经搞定了！ 4.就可以右键新建Servlet 总结 IDEA版本2021右键新建没有servlet?在pom.xml文件中需要导入ser

2024-10-14 19:56:52

目录问题解决步骤：找到File->Project Structure... 设置SDK 设置SDKs 问题刚刚在使用IDEA专业版创建好SpringBoot项目后，发现上方导航栏的运行按钮是灰色的，而且左侧导

2024-10-14 19:56:37

实现flex的分页查询需要去维护一个对应的获取数据库总数的方法，下面会对有无该方法进行一个比较实现文件主要以下几个类，注意UserMapper.xml的位置，默认是扫描resources下的map

2024-10-14 19:56:23

目录在编译项目的时候出现报错：解决办法： 1、无效的源发行版 2、IDEA 报错，java无效的目标发行版：22 无效的目标发行版总结在编译项目的时候出现报错：解决办法：1、无效

2024-10-14 19:56:09

目录 1、目的 2、实现 2-1、导入MyBatis-Flex和ShardingSphere-JDBC的相关依赖 2-2、配置初始化的数据库连接用来加载配置，当然用配置中心来保存初始化数据的配置 2-3、

2024-10-14 19:55:50

前端发送请求后，会请求DeptController的方法list()。package com.intelligent_learning_aid_system.controller;import com.intelligent_learning_aid_system.pojo.Dept;impo

2024-10-14 19:55:31

Java 函数式编程中 try-catch 块的替代方案在 Java 函数式编程中，传统意义上的 try-catch 块并不是必不可少的。函数式编程强调代码的不可变性和纯净性，这意味着我们不希望函

2024-09-17 21:25:34

Java 函数参数可以定义多个类型吗？在 Java 中，函数的参数可以定义多个类型，这称为方法重载。通过方法重载，可以创建具有相同名称但接受不同参数类型的多个函数版本。语法<return

2024-09-17 21:23:26

如何在 Java 中使用 lambda 表达式实现接口方法Java 8 引入了 lambda 表达式，它提供了简洁且方便的方法来实现接口方法。lambda 表达式是一种匿名函数，它可以用来替换实现接口

2024-09-17 21:22:43

在 java 中，函数的返回值类型指定函数返回的值的类型，位于函数签名中函数名之前。例如，getgreeting 函数返回一个字符串 string getgreeting() { return "hello!"; }。返回值类

2024-09-10 22:37:27

2021-02-06

2020-09-18

2020-12-12

2020-05-05

2020-11-20

2021-01-09

2020-09-25

2021-02-06

2021-03-07

2020-09-27

使用IDEA搭建Hadoop开发环境的操作步骤(Window10为例)

下载安装Hadoop

解压文件

配置环境变量

验证环境变量配置

编写Java文件

热点内容

免费资源网

在线工具

扫一扫随时看

本站下载频道