SpringCloud大文件分片断点上传实现原理

时间：2020-05-26

阅读：

1背景

用户本地有一份txt或者csv文件，无论是从业务数据库导出、还是其他途径获取，当需要使用蚂蚁的大数据分析工具进行数据加工、挖掘和共创应用的时候，首先要将本地文件上传至ODPS，普通的小文件通过浏览器上传至服务器，做一层中转便可以实现，但当这份文件非常大到了10GB级别，我们就需要思考另一种形式的技术方案了，也就是本文要阐述的方案。

技术要求主要有以下几方面：

支持超大数据量、10G级别以上

稳定性：除网络异常情况100%成功

准确性：数据无丢失，读写准确性100%

效率：1G文件分钟级、10G文件小时级

体验：实时进度感知、网络异常断点续传、定制字符特殊处理

2文件上传选型

文件上传至ODPS基本思路是先文件上传至某中转区域存储，然后同步至ODPS，根据存储介质可以分为两类，一类是应用服务器磁盘，另一类类是中间介质，OSS作为阿里云推荐的海量、安全低成本云存储服务，并且有丰富的API支持，成为中间介质的首选。而文件上传至OSS又分为web直传和sdk上传两种方案，因此上传方案有如下三种，详细优缺点对比如下：

蚂蚁的文本上传功能演进过程中对第一种、第二种方案均有实践，缺点比较明显，如上表所述，不满足业务需求，因此大文件上传终极方案是方案三。

3整体方案

以下是方案三的整体过程示意图。

请求步骤如下：

用户向应用服务器取到上传policy和回调设置。

应用服务器返回上传policy和回调。

用户直接向OSS发送文件上传请求。
等文件数据上传完，OSS给用户Response前，OSS会根据用户的回调设置，请求用户的服务器。如果应用服务器返回成功，那么就返回用户成功，如果应用服务器返回失败，那么OSS也返回给用户失败。这样确保了用户上传成功，应用服务器已经收到通知了。

应用服务器给OSS返回。

OSS将应用服务器返回的内容返回给用户。

启动后台同步引擎执行oss到odps的数据同步。

同步实时进度返回返回给应用服务器，同时展示给用户。

4技术方案

4.1上传

OSS提供了丰富的SDK，有简单上传、表单上传、断点续传等等，对于超大文件提供的上传功能建议采用断点续传方式，优点是可以对大文件并行分片上传，利用OSS的并行处理能力，中间暂停也可以从当前位置继续上传，网络环境影响可以降到最低。

4.2下载

OSS文件下载同样也有多种方式，普通下载、流式下载、断点续传下载、范围下载等等，若直接下载到本地同样建议断点续传下载，但我们的需求并不仅仅是下载文件本地存储，而是读取文件做数据从OSS到ODPS的同步，因此不做中间存储，直接边读变写，一方面采用OSS流式读取，一方面ODPS tunnel上传，用多线程读写方式提高同步速率。

4.3两阶段数据转移

文件从本地到ODPS可以分为两个阶段，第一阶段前端分片断点续传将本地文件上传至OSS，第二阶段后端流式读写将数据从OSS同步至ODPS，如下图所示：

涉及技术点：

4.3.1前端，js sdk带STS token 安全上传

在需要上传的文件较大时，可以通过multipartUpload接口进行分片上传。分片上传的好处是将一个大请求分成多个小请求来执行，这样当其中一些请求失败后，不需要重新上传整个文件，而只需要上传失败的分片就可以了。一般对于大于100MB的文件，建议采用分片上传的方法，每次进行分片上传都建议重新new一个新的OSS实例。

阿里云分片上传流程主要会调用3个api，包含

InitiateMultipartUpload, 分片任务初始化接口。

UploadPart,单独的分片上传接口。

CompleteMultipartUpload, 分片上传完成后任务完成接口

临时访问凭证是通过阿里云Security Token Service(STS)来实现授权的一种方式。其实现请参见STS Java SDK。临时访问凭证的流程如下：

客户端向服务器端发起获得授权的请求。服务器端先验证客户端的合法性。如果是合法客户端，那么服务器端会使用自己的AccessKey来向STS发起一个请求授权的请求，具体可以参考访问控制。

服务器端获取临时凭证之后返回给客户端。

客户端使用获取的临时凭证来发起向OSS的上传请求，更详细的请求构造可以参考临时授权访问。客户端可以缓存该凭证用来上传，直到凭证失效再向服务器端请求新的凭证。

4.3.2后端，多线程流式读写

OSS端：如果要下载的文件太大，或者一次性下载耗时太长，可以多线程流式下载，一次处理部分内容，直到完成文件的下载。
ODPS端：tunnel sdk对OSS流式数据直接写入，一次完整的数据写入流程通常包括以下步骤：
先对数据进行划分;

为每个数据块指定 block id，即调用 openRecordWriter(id);

然后用一个或多个线程分别将这些 block 上传上去, 并在某个 block 上传失败以后，需要对整个 block 进行重传;

在所有 block 都上传以后，向服务端提供上传成功的 blockid list 进行校验，即调用 session.commit([1,2,3,…])
而由于服务端对block管理，连接超时等的一些限制，上传过程逻辑变得比较复杂，为了简化上传过程，SDK提供了更高级的一种RecordWriter——TunnelBufferWriter。

5总结

实测结果显示，本文的上传方案实现了第一节提出的几点技术要求，如下：

支持超大数据量、10G级别以上没有任何压力，主要是前端在分片上传设置好分片限额即可（最大10000片，每片最大100G），目前设置每片1M满足10G需求。

稳定性：实测观察网络异常情况较少，文件内容正常情况下100%成功。

准确性：实测数据无丢失，读写准确性100%。

效率：办公网带宽1.5M/s的情况下1G文件分钟级、10G文件小时级，实际速度视用户端的当前网络带宽变化。

体验：实时进度感知、网络异常断点续传、定制字符特殊处理等高级功能可以提升用户体验。

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持。

目录 mybatis resultType自带数据类型别名定义了一些常见类的别名整理成表格总结 mybatis resultType自带数据类型别名为了简化开发，mybatis 默认在 org.apache.ibat

2024-10-20 21:52:35

目录 1. 引言 2. 核心代码解析 2.1 POM依赖 2.2 SpringBoot启动类注解 2.3 核心代码总结 3. Spring 注解说明 3.1 @Retryable注解 3.2 @Backoff注解 4. 如何使用

2024-10-20 21:52:26

目录 Spring Boot API 中的速率限制步骤 1 - 定义速率限制配置步骤 2 - 创建速率限制方面步骤 3 — 定义 RateLimited 注释步骤 4 - 实施速率限制器步骤 5

2024-10-20 21:52:18

目录引言 1. 使用 Spring Boot 默认的 Logback 日志框架步骤： 2. 使用 Log4j2 日志框架步骤： 3. 在代码中使用日志 4.使用lombok.extern.slf4j.Slf4j 1.基本使用

2024-10-20 21:52:11

目录前言 1.方法一：反射获取线程池中的线程列表 2.方法二：使用Thread.getAllStackTraces() 3.方法三：使用ThreadPoolExecutor的getCompletedTaskCount()和getActiveCount()等

2024-10-20 21:52:03

目录一、使用 @Scheduled 注解二、使用 SchedulingConfigurer 接口三、使用 TaskScheduler 四、使用 Quartz 实现定时任务一、使用 @Scheduled 注解@Scheduled 是 Spring

2024-10-20 21:51:49

目录引言一、问题描述： 1.1 报错示例： 1.2 报错分析： 1.3 解决思路：二、解决方法： 2.1 方法一： 2.2 方法二： 2.3 方法三： 2.4 方法四：三、其他解决方法：四、总结：

2024-10-20 21:51:41

目录 SpringBoot项目启动报错：命令行太长解决 1. 第一种方法 1. 第二种方法 1-1 旧版本Idea 1-2 新版本Idea SpringBoot项目启动报错：命令行太长解决报错信息：1. 第

2024-10-20 21:51:32

目录前言一、Spring Boot 日志框架概述 1.1 Spring Boot 支持的日志框架 1.2 Spring Boot 默认日志配置二、日志框架冲突问题 2.1 问题描述 2.2 解决方案 2.3 检

2024-10-20 21:51:18

目录前言一、Maven 简介二、为什么需要手动添加 JAR 文件？三、Maven 本地仓库位置如何确认本地仓库位置？四、创建必要的目录结构创建目录结构的步骤：五、创建 PO

2024-10-20 21:51:10

目录什么是职责链模式？职责链模式在电商订单流程中的应用 POM 文件配置具体处理器实现控制器接口优化前端界面及 jQuery 调用 JSON 接口总结在电商系统中，订单的处理流

2024-10-18 23:26:01

目录 1.生成war包 1.1 更改pom包 1.2 编写类 1.3 将war包使用 tomcat 解压为文件夹 1.生成war包1.1 更改pom包打开一个springboot 项目，右击项目名从项目管理器打开在po

2024-10-18 23:25:45

数据库表中的字段创建时间 (createTime) 更新时间 (updateTime)每次增删改查的时候，需要通过对Entity的字段（createTime，updateTime）进行set设置，但是，每次增删改都要set设置比

2024-10-18 23:25:25

目录主键策略 1、AUTO(自动增长策略) 2、INPUT(插入前自行设置主键值) 3、ASSING_ID(雪花算法) 4、ASSING_UUID(不含中划线的UUID) 5、NONE(无状态) 雪花算法算

2024-10-18 23:25:12

目录第一个Hystrix程序步骤1：创建父工程hystrix-1 步骤2：改造服务提供者步骤3：改造服务消费者为Hystrix客户端（1）添加Hystrix依赖（2）添加@EnableHystrix注解（3）创

2024-10-18 23:24:58

目录 Config与Bus整合自动刷新步骤1：安装RabbitMQ并启动 RabbitMQ的安装步骤2：创建项目创建Eureka Server 创建config-server 步骤3：添加依赖修改配置文件步骤4：Co

2024-10-18 23:24:27

目录 1. 前言 2. 注册 2.1. 手机验证码注册流程 2.2. 代码实现（仅核心） 3. 登录 3.1. 手机验证码登录流程 3.2. 涉及到的Spring Security组件 3.3. 代码实现（仅核心）

2024-10-18 23:23:50

目录 Java中重写和重载的区别方法重载的规则方法重写的规则总结 Java中重写和重载的区别其实java中的重写和重载没有任何关系，只是因为都有个重字，有些小白就会对这两

2024-10-18 23:23:37

目录 1. 什么是 Spring Web MVC 1.1 MVC 定义 1.2 什么是 Spring MVC 2. 学习 Spring MVC 2.1 项目准备 2.2 建立连接 1. 什么是 Spring Web MVCSpring Web MVC 是基

2024-10-18 23:23:29

目录 springBoot跨域注解@CrossOrigin用法在controller控制类上方加注解 spring注解@CrossOrigin不起作用的原因总结 springBoot跨域注解@CrossOrigin用法Spring Fra

2024-10-18 23:23:14

目录 1. 找到自动生成的pom.xml文件 2.添加servlet依赖 3.别眨眼，你已经搞定了！ 4.就可以右键新建Servlet 总结 IDEA版本2021右键新建没有servlet?在pom.xml文件中需要导入ser

2024-10-14 19:56:52

目录问题解决步骤：找到File->Project Structure... 设置SDK 设置SDKs 问题刚刚在使用IDEA专业版创建好SpringBoot项目后，发现上方导航栏的运行按钮是灰色的，而且左侧导

2024-10-14 19:56:37

实现flex的分页查询需要去维护一个对应的获取数据库总数的方法，下面会对有无该方法进行一个比较实现文件主要以下几个类，注意UserMapper.xml的位置，默认是扫描resources下的map

2024-10-14 19:56:23

目录在编译项目的时候出现报错：解决办法： 1、无效的源发行版 2、IDEA 报错，java无效的目标发行版：22 无效的目标发行版总结在编译项目的时候出现报错：解决办法：1、无效

2024-10-14 19:56:09

目录 1、目的 2、实现 2-1、导入MyBatis-Flex和ShardingSphere-JDBC的相关依赖 2-2、配置初始化的数据库连接用来加载配置，当然用配置中心来保存初始化数据的配置 2-3、

2024-10-14 19:55:50

前端发送请求后，会请求DeptController的方法list()。package com.intelligent_learning_aid_system.controller;import com.intelligent_learning_aid_system.pojo.Dept;impo

2024-10-14 19:55:31

Java 函数式编程中 try-catch 块的替代方案在 Java 函数式编程中，传统意义上的 try-catch 块并不是必不可少的。函数式编程强调代码的不可变性和纯净性，这意味着我们不希望函

2024-09-17 21:25:34

Java 函数参数可以定义多个类型吗？在 Java 中，函数的参数可以定义多个类型，这称为方法重载。通过方法重载，可以创建具有相同名称但接受不同参数类型的多个函数版本。语法<return

2024-09-17 21:23:26

如何在 Java 中使用 lambda 表达式实现接口方法Java 8 引入了 lambda 表达式，它提供了简洁且方便的方法来实现接口方法。lambda 表达式是一种匿名函数，它可以用来替换实现接口

2024-09-17 21:22:43

在 java 中，函数的返回值类型指定函数返回的值的类型，位于函数签名中函数名之前。例如，getgreeting 函数返回一个字符串 string getgreeting() { return "hello!"; }。返回值类

2024-09-10 22:37:27

2021-02-06

2020-09-18

2020-12-12

2020-05-05

2020-11-20

2021-01-09

2020-09-25

2021-02-06

2021-03-07

2020-09-27

SpringCloud大文件分片断点上传实现原理

mybatis resultType自带数据类型别名解读

Java使用@Retryable注解实现HTTP请求重试

SpringBoot中基于AOP和Semaphore实现API限流

SpringBoot中集成日志的四种方式

Java线程池获取池中所有线程列表的方法总结

SpringBoot创建动态定时任务的几种方式小结

Java报错Java.net.SocketTimeoutException的几种解决方法

SpringBoot项目启动报错：命令行太长解决的两种解决方法

SpringBoot项目中日志管理与调优指南

将本地JAR文件手动添加到Maven本地仓库的实现过程

Spring Boot 3.3 实现职责链模式轻松应对电商订单流程分析

使用SpringBoot生成war包的流程步骤

mybatisplus实现自动填充时间的项目实践

MybatisPlus 主键策略的几种实现方法

Spring Cloud Hystrix实现服务容错的方法

Spring Cloud Config与Bus整合实现微服务配置自动刷新功能

使用Spring Security集成手机验证码登录功能实现

Java中重写和重载的区别及说明

Spring MVC的项目准备和连接建立方法

springBoot跨域注解@CrossOrigin用法

IDEA的Web项目右键无法创建Servlet问题解决办法

创建好SpringBoot项目后但是找不到Maven的解决方法

MyBatis-Flex实现分页查询的示例代码

解决IDEA报错java无效的目标发行版:22

MyBatis-Flex+ShardingSphere-JDBC多数据源分库分表实现

springboot查询全部部门流程分析

Java函数式编程中是否有try-catch块的替代方案？

Java函数的参数是否可以定义多个类型？

如何在Java中使用lambda表达式实现接口方法？

Java函数的返回值类型如何定义？

热点内容

免费资源网

在线工具

扫一扫随时看

本站下载频道