2-HDFS常用命令及上传下载流程

news/2024/4/29 10:43:51/文章来源:https://blog.csdn.net/m0_73450879/article/details/137121479

HDFS

NameNode

安全模式(safemode)

  1. 当NameNode被重启的时候,自动进入安全模式

  2. 在安全模式中,NameNode首先会触发edits_inprogress文件的滚动。滚动完成之后,更新fsimage文件

  3. 更新完成之后,NameNode会将fsimage文件中的元数据加载到内存中。加载完成之后,NameNode等待DataNode的心跳

  4. 如果NameNode没有收到DataNode的心跳,那么此时NameNode就会认为这个DataNode已经lost,那么此时NameNode会将这个DataNode上的数据备份到其他的节点上来保证副本数量;如果NameNode收到了DataNode的心跳,那么会对这个DataNode上的Block存储情况进行校验。如果校验成功,那么NameNode自动退出安全模式;如果校验失败,那么NameNode会试图恢复这个DataNode上的数据(每个DataNode的全部数据都会在其他DataNode上有备份),恢复完成之后,会重新校验;校验成功之后,才会退出安全模式

  5. 在安全模式下,HDFS只提供读(下载)操作,不提供写(上传)操作

  6. 如果在合理的时间内,HDFS依然没有退出安全模式,那么说明数据已经产生了不可逆的损坏或者丢失(这个数据的所有副本都损坏或者丢失)

  7. 安全模式的命令

    命令解释
    hdfs dfsadmin -safemode enter进入安全模式
    hdfs dfsadmin -safemode leave退出安全模式
    hdfs dfsadmin -safemode get获取安全模式的状态

DataNode

  1. DataNode是HDFS的从进程,负责存储数据。DataNode会将数据以Block形式落地到本地的磁盘上
  2. Block在磁盘上的存储位置由dfs.datanode.data.dir属性来决定的,默认值是file://${hadoop.tmp.dir}/dfs/data,由hadoop.tmp.dir属性来决定
  3. DataNode会为每一个Block生成一个.meta文件,.meta文件实际上是这个Block的校验文件
  4. DataNode会通过心跳向NameNode注册信息
  5. DataNode的状态:预服役、服役、预退役、退役

SecondaryNameNode

  1. SecondaryNameNode不是NameNode的备份,而是辅助进程,用于辅助NameNode完成edits_inprogress文件的滚动和fsimage文件的更新

    1. 如果HDFS集群中存在SecondaryNameNode,那么fsimage文件的更新是由SecondaryNameNode来完成
    2. 如果HDFS集群中不存在SecondaryNameNode,那么fsimage文件的更新是由NameNode自己来完成
  2. 因此,SecondaryNameNode不是必须的进程。实际过程中,NameNode和SecondaryNameNode不是在同一个节点上

  3. fsimage文件的更新过程

    fsimage更新
  4. 由于HDFS集群的限制,HDFS集群支持两种模式

    1. 1个NameNode+1个SecondayNameNode+n个DataNode
    2. n个NameNode+n个DataNode

    考虑到NameNode作为核心节点,必须对NameNode来进行备份。所以实际过程中,采用上述的第二种结构

机架感知策略

  1. 在HDFS集群中,机架指的是逻辑机架。默认情况下,机架感知策略是不开启的

  2. 逻辑机架:通过一个映射(map)来定义主机和机架之间的关联。将主机名或者IP作为键,将机架作为值,只要值相同,就表示不同的服务器是位于相同的机架上的

    # hadoop01~hadoop03都是属于机架r1,hadoop04~05都是属于机架r2
    rack = {"hadoop01":"r1","hadoop02":"r1","hadoop03":"r1","hadoop04":"r2","hadoop05":"r2"
    }
    
  3. 如果需要开启机架感知策略,那么需要在hadoop-site.xml文件中配置

    <property><name>net.topology.script.file.name</name><value>脚本的路径</value>
    </property>
    

    实际过程中,一般是通过shell或者python来定义脚本文件

  4. 理论上而言,可以将同一个物理机架上的节点配置到不同的逻辑机架上,也可以将不同物理机架上的节点配置到同一个逻辑机架上

副本放置策略

  1. HDFS为了保证数据的可靠性,默认采用的是多副本策略。默认情况下,每一个Block对应了3个副本。副本数量可以通过dfs.replication属性来调节
  2. 在HDFS中,如果不开启机架感知策略,副本是放在相对空闲的节点上;如果开启了机架感知策略,那么对应的会开启副本放置策略
    1. 第一个副本:如果是集群内部上传,谁上传就放在谁身上;如果是集群外部上传,谁空闲就放在谁身上
    2. 第二个副本:放在和第一个副本相同机架的不同节点上
    3. 第三个副本:放在和第二个副本不同机架的节点上
    4. 更多副本:谁空闲放在谁身上

命令和操作

启动命令

命令解释
start-dfs.sh启动HDFS
stop-dfs.sh关闭HDFS
hdfs --daemon start namenode启动NameNode
hdfs --daemon start datanode启动DataNode
hdfs --daemon start secondarynamenode启动SecondaryNameNode
hdfs --daemon stop namenode关闭NameNode
hdfs --daemon stop datanode关闭DataNode
hdfs --daemon stop secondarynamenode关闭SecondaryNameNode

基本命令

命令解释
hadoop fs -put a.txt /
或者
hadoop fs -copyFromLocal a.txt / (过时)
将a.txt上传到HDFS的根目录下
hadoop fs -ls / 查看子文件和子目录
hadoop fs -ls -R /递归查看
hadoop fs -cat /a.txt查看文件内容
hadoop fs -appendToFile b.txt /a.txt将本地的b.txt的内容追加到HDFS的a.txt中
hadoop fs -checksum /a.txt计算校验和(就是获取这个文件的md5计算结果)
hadoop fs -chown tom /a.txt更改文件所属用户
hadoop fs -chmod 777 /a.txt更改文件的权限
hadoop fs -chgrp test /a.txt更改文件的用户组
hadoop fs -copyToLocal /a.txt /opt/test.txt
或者
hadoop fs -get /a.txt /opt/test.txt
下载文件
hadoop fs -cp /a.txt /b.txt复制文件
hadoop fs -mv /a.txt /test.txt剪切或者重命名文件
hadoop fs -df /查看HDFS的容量
hadoop fs -du /b.txt查看文件的大小
hadoop fs -setrep 3 /b.txt(上传文件时指定副本数量,这个参数优先级高于默认的副本数量)指定副本数量

回收站机制

  1. 在HDFS中,回收站机制默认是不开启的,即删除命令会立即生效,无法撤销

  2. 如果需要开启回收站机制,那么需要在core-site.xml文件中做配置

    <!-- 指定文件在回收站中临时的存放时间 -->
    <!-- 单位默认是min -->
    <!-- 如果不指定,默认情况下值为0,即删除要立即生效 -->
    <!-- 如果超过指定时间,没有将文件从回收站中移出来,那么这个文件就会被清理掉 -->
    <property><name>fs.trash.interval</name><value>1440</value>
    </property>
    
  3. 回收站的默认路径是:/user/${user.name}/.Trash/Current/

  4. 如果需要将文件从回收站中挪出来,那么使用hadoop fs -mv命令即可

流程

删除流程

  1. 客户端发起RPC请求到NameNode,请求删除指定文件
  2. NameNode收到请求之后,会进行校验
    1. 校验是否有写入权限 - AccessControlException
    2. 校验是否有指定文件 - FileNotFoundException
  3. 如果校验失败,那么会报错;如果校验成功,那么NameNode修改元数据;修改完元数据之后,NameNode会给客户端返回一个ACK信号表示删除成功!注意,此时文件并没有真正从HDFS上移除,仅仅是修改了元数据!
  4. NameNode会等待DataNode的心跳,收到DataNode的心跳之后,会在心跳响应中要求DataNode删除对应的Block
  5. DataNode收到心跳响应之后,才回去磁盘上删除这个文件对应的Block。注意,此时,文件才真正从HDFS上移除!

写入(上传)流程

  1. 客户端通过DistributedFileSystem向NameNode发送RPC请求,请求上传指定文件

  2. NameNode收到请求之后,会进行校验

    1. 校验是否有写入权限 - AccessControlException
    2. 校验是否有同名文件 - FileAlreadyExistException
  3. 如果校验失败,那么直接报错;如果校验成功,NameNode会给客户端返回一个信号表示允许上传

  4. 客户端在收到信号之后,会再次给NameNode发送请求,请求获取第一个Block的存储地址

  5. NameNode收到请求之后,会查询元数据,根据副本放置策略,将这个Block的存储位置放入队列中返回给客户端。存储位置其实就是DataNode的主机名/IP,默认情况下,返回的是3个地址(副本数量默认为3)

  6. 客户端收到队列之后,会从队列中将地址全部取出,取出之后,会从中选择一个较近(网络拓扑距离的远近)的节点,通过FSDataOutputStream来请求建立pipeline(管道),来写入当前Block的第一个副本;第一个副本写完之后,这个副本所在的节点会通过pipeline将这个Block的第二个副本写入;第二个副本写完之后,这个副本所在的节点会通过管道来写入下一个节点

  7. 当这个Block的最后一个副本写完之后,会给上一个副本所在的节点返回一个ACK信号表示成功;上一个副本所在的节点收到ACK之后,会继续往前返回ACK,直到返回给客户端

  8. 当客户端收到ACK之后,会再次给NameNode发送请求,请求获取下一个Block的存储位置,重复5.6.7三个步骤,直到所有的Block全部写完

  9. 当所有的Block全部写完之后,客户端会给NameNode发送一个结束信号(关流)。NameNode收到信号之后,会关闭文件。文件一旦关闭就不能修改!

    上传流程

读取(下载)流程

  1. 客户端通过DistributedFileSystem向NameNode发送RPC请求,请求读取指定文件

  2. NameNode收到请求之后,会进行校验

    1. 校验是否有读取权限 - AccessControlException
    2. 校验是否有指定文件 - FileNotFoundException
  3. 如果校验失败,则直接报错;如果校验成功, 那么NameNode会给客户端返回一个信号表示允许读取

  4. 客户端收到信号之后,会再次给NameNode发送请求,请求获取第一个Block的存储位置

  5. NameNode收到请求之后,会查询元数据,将这个Block的存储位置以及Block的校验信息放入队列中返回给客户端

  6. 客户端收到队列之后,会将地址从队列中全部取出,从中选择一个较近(网络拓扑距离较近)的节点,通过FSDataInputStream来读取这个Block

  7. 读取完成之后,客户端会对这个Block进行一次checkSum校验。如果校验失败,那么客户端会从剩余的地址中重新选取地址重新读取重新校验;如果校验成功,那么客户端会再次给NameNode发送请求,请求获取下一个Block的位置,重复5.6.7,直到所有的Block全部读取完毕

  8. 当所有的Block都读取完之后,客户端会给NameNode发送一个结束信号

    读取流程

特点

  1. 支持超大文件。HDFS会对文件进行切块处理,所以集群规模越大,能够存储的文件就越大
  2. 能够快速的应对和检测故障。HDFS通过心跳来管理DataNode,通过心跳可以确定DataNode的状态以及Block的状态
  3. 高容错性。HDFS对文件进行备份,从而保证不会因为一个节点宕机就产生数据丢失
  4. 可以在相对廉价的机器上来进行横向扩展
  5. 不支持低延迟数据访问。HDFS的设计初衷就是为了存储超大文件,因此考虑的是数据的吞吐量而不是响应速度
  6. 不建议存储小文件。每一个小文件对应的会产生一条元数据,小文件多了,就意味着元数据会增多,那么会导致内存占用变大,同时会导致查询效率降低
  7. 简化的一致性模型。HDFS支持一次写入多次读取,不支持修改但是支持追加写入
  8. 不支持事务或者支持弱事务。这就意味着在HDFS中,即使数据写错也不能修改
  9. 存储的超大文件允许小部分数据出错。HDFS通常是TB级的日志级别,然后对其数据分析。其中几MB的数据出错并不会影响最终的分析结果。

补充

RPC

  1. RPC(Remote Procedure Call),远程过程调用,指的是允许程序员在一个节点上远程调用另一个节点上的程序或者功能,而不需要显式的实现这个功能
  2. RPC是Nelson在1990年的论文中提出的理论,现在RPC已经成为了分布式中最重要的通讯方式
  3. 存储的超大文件允许小部分数据出错。HDFS通常是TB级的日志级别,然后对其数据分析。其中几MB的数据出错并不会影响最终的分析结果。

补充

RPC

  1. RPC(Remote Procedure Call),远程过程调用,指的是允许程序员在一个节点上远程调用另一个节点上的程序或者功能,而不需要显式的实现这个功能
  2. RPC是Nelson在1990年的论文中提出的理论,现在RPC已经成为了分布式中最重要的通讯方式
  3. stub(存根):保证两端能够调用的函数是相同的,在Java中通常使用接口来实现

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.luyixian.cn/news_show_1027893.aspx

如若内容造成侵权/违法违规/事实不符,请联系dt猫网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

利用云手机技术,开拓海外社交市场

近年来&#xff0c;随着科技的不断进步&#xff0c;云手机技术逐渐在海外社交营销领域崭露头角。其灵活性、成本效益和全球性特征使其成为海外社交营销的利器。那么&#xff0c;究竟云手机在海外社交营销中扮演了怎样的角色呢&#xff1f; 首先&#xff0c;云手机技术能够消除地…

腾讯云4核8G服务器价格,12M带宽一年646元,送3个月

2024年腾讯云4核8G服务器租用优惠价格&#xff1a;轻量应用服务器4核8G12M带宽646元15个月&#xff0c;CVM云服务器S5实例优惠价格1437.24元买一年送3个月&#xff0c;腾讯云4核8G服务器活动页面 txybk.com/go/txy 活动链接打开如下图&#xff1a; 腾讯云4核8G服务器优惠价格 轻…

Eclipse的基本使用讲解(建项目,建包,建类,写代码(基本语法))新手入门必备

目录 一.介绍eclipse 二.操作Eclipse 1.选择工作空间 2.建项目&#xff0c;建包&#xff0c;建类 1.建项目(两种) 2.建包 3.建类 三.写代码(基本语法) 1.代码操作 2.代码规范 3.代码注释 一.介绍eclipse Eclipse 是一个开放源代码的、基于Java的可扩展开发平台。就其…

【LeetCode热题100】124.二叉树的最大路径和(二叉树)

一.题目要求 二叉树中的 路径 被定义为一条节点序列&#xff0c;序列中每对相邻节点之间都存在一条边。同一个节点在一条路径序列中 至多出现一次 。该路径 至少包含一个 节点&#xff0c;且不一定经过根节点。 路径和 是路径中各节点值的总和。 给你一个二叉树的根节点 root …

Qt打印系统库的日志 - QLoggingCategory

Qt的动态库通过源码可以可以看到含有大量的qCInfo 和 qCDebug 等大量的日志&#xff0c; 但是我们正常运行Qt程序&#xff0c;这些动态库或插件里面的日志是不会输出到我们的控制台里面的。 所以本章主要记录怎么输出这些日志出来。 一&#xff1a; 步骤 主要使用的是Qt的 函…

macOS 13 Ventura (苹果最新系统) v13.6.6正式版

macOS 13 Ventura是苹果电脑的全新操作系统&#xff0c;它为用户带来了众多引人注目的新功能和改进。该系统加强了FaceTime和视频通话的体验&#xff0c;同时优化了邮件、Safari浏览器和日历等内置应用程序&#xff0c;使其更加流畅、快速和安全。特别值得一提的是&#xff0c;…

基于51单片机的客车汽车安全气囊控制器Proteus仿真

地址&#xff1a;https://pan.baidu.com/s/10enj1EYm_0Z8f_19Sz_eCQ 提取码&#xff1a;1234 仿真图&#xff1a; 芯片/模块的特点&#xff1a; AT89C52简介&#xff1a; AT89C52是一款经典的8位单片机&#xff0c;是意法半导体&#xff08;STMicroelectronics&#xff09;公…

[创建型模型] 原型模式

一 介绍 原型设计模式&#xff0c;允许通过复制已有对象的实例&#xff0c;来创建新的对象&#xff0c;并且不需要显示的实例化过程。 目的是通过复制现有对象来创建新对象&#xff0c;从而减少了对象的实例化开销。(避免了一些数据的初始化,读取,加载数据&#xff0c;资源的…

原生 HTML/CSS/JS 实现右键菜单和二级菜单

文章来源&#xff1a;www.huhailong.vip 站点 文章源地址&#xff1a;https://www.huhailong.vip/article/1764653112011841538 Demo效果演示地址 先看效果图 {{{width“auto” height“auto”}}} 需要注意的就是边界检测处理&#xff0c;到极端点击底部和右侧时如果不做处理会…

外包干了8天,技术退步明显.......

先说一下自己的情况&#xff0c;大专生&#xff0c;19年通过校招进入杭州某软件公司&#xff0c;干了接近4年的功能测试&#xff0c;今年年初&#xff0c;感觉自己不能够在这样下去了&#xff0c;长时间呆在一个舒适的环境会让一个人堕落! 而我已经在一个企业干了四年的功能测…

React系列之框架特点和组件类型

文章目录 ReactMVC MVP MVVM单/双向数据绑定React特点JSX 组件和不同类型 React MVC MVP MVVM Web设计模式&#xff0c;通过分离模块来改进代码的组织方式。 MVC 是 Model View Controller 的缩写。 Model&#xff1a;模型层&#xff0c;数据相关的操作。View&#xff1a;视…

linux 环境安装配置

安装java17 1.下载安装包 wget https://download.oracle.com/java/17/latest/jdk-17_linux-x64_bin.tar.gz 2.解压到自定义目录/usr/local/java mkdir /usr/local/java tar zxvf jdk-17_linux-x64_bin.tar.gz -C /usr/local/java 3.配置环境变量 echo export PATH$PATH:/…

Mac添加和关闭开机应用

文章目录 mac添加和关闭开机应用添加开机应用删除/查看 mac添加和关闭开机应用 添加开机应用 删除/查看 打开&#xff1a;系统设置–》通用–》登录项–》查看登录时打开列表 选中打开项目&#xff0c;点击“-”符号

Vue指令之v-bind

v-bind用于动态设置html的标签属性&#xff0c;如src、url、title等&#xff0c;因为插值表达式{{}}没有办法用在标签属性上&#xff0c;需要用到其他工具。 比如前端要根据后端传来的参数&#xff0c;动态的显示图片&#xff0c;就需要把图片的src属性绑定到Vue实例的一个变量…

ensp中pc机访问不同网络的服务器

拓扑图如下&#xff0c;资源已上传 说明&#xff1a;pc通过2个路由访问server服务器 三条线路分别是192.168.1.0网段&#xff0c;192.168.2.0网段和192.168.3.0网段&#xff0c;在未配置的情况下&#xff0c;pc设备是访问不到server的 具体操作流程 第一&#xff1b;pc设备…

星光/宝骏/缤果/长安 车机CarPlay手机操作破解教程V2.0版本(无需笔记本、无需笔记本、无需笔记本)

之前写了个1.0版本&#xff0c;由于太局限&#xff0c;需要用到笔记本才能操作&#xff0c;很多车友反馈不方便。特此出个手机版教程&#xff0c;简单easy&#xff0c;妈妈再也不用担心我搞不定啦 一、准备工作 先卸载车机上的autokit 或者 智能互联 app&#xff0c;这步很关…

RPA使用Native Messaging协议实现浏览器自动化

RPA 即机器人流程自动化&#xff0c;是一种利用软件机器人或人工智能来自动化业务流程中规则性、重复性任务的技术。RPA 技术可以模拟和执行人类在计算机上的交互操作&#xff0c;从而实现自动化处理数据、处理交易、触发通知等任务。帮助企业或个人实现业务流程的自动化和优化…

Apache ActiveMQ OpenWire 协议反序列化命令执行漏洞分析 CVE-2023-46604

Apache ActiveMQ 是美国阿帕奇&#xff08;Apache&#xff09;软件基金会所研发的一套开源的消息中间件&#xff0c;它支持Java消息服务、集群、Spring Framework等。 OpenWire协议在ActiveMQ中被用于多语言客户端与服务端通信。在Apache ActiveMQ 5.18.2版本及以前&#xff0…

多源统一视频融合可视指挥调度平台VMS/smarteye系统概述

系统功能 1. 集成了视频监控典型的常用功能&#xff0c;包括录像&#xff08;本地录像、云端录像&#xff08;录像计划、下载计划-无线导出&#xff09;、远程检索回放&#xff09;、实时预览&#xff08;PTZ云台操控、轮播、多屏操控等&#xff09;、地图-轨迹回放、语音对讲…

Node爬虫:原理简介

在数字化时代&#xff0c;网络爬虫作为一种自动化收集和分析网络数据的技术&#xff0c;得到了广泛的应用。Node.js&#xff0c;以其异步I/O模型和事件驱动的特性&#xff0c;成为实现高效爬虫的理想选择。然而&#xff0c;爬虫在收集数据时&#xff0c;往往面临着诸如反爬虫机…