大数据工程师都需要懂什么-大数据工程师都需要懂什么文档介绍内容-阿里云

MySQL分库分表同步至MaxCompute

尤其是在MySQL分库分表的场景下，上游的数据库和表非常多，都需要同时写入一张MaxCompute表，如果同时配置多个任务会导致配置非常复杂且运维困难。针对以上痛点，DataWorks数据集成一键同步解决方案提供了面向业务场景的同步任务配置化方案...

MySQL分库分表同步至MaxCompute

尤其是在MySQL分库分表的场景下，上游的数据库和表非常多，都需要同时写入一张MaxCompute表，如果同时配置多个任务会导致配置非常复杂且运维困难。针对以上痛点，DataWorks数据集成一键同步解决方案提供了面向业务场景的同步任务配置化方案...

冷热分层

Delta Lake是新型数据湖方案，推出了数据流入、数据组织管理、数据查询和数据流出等特性，同时提供了数据的ACID和CRUD操作。通过结合Delta Lake和上下游组件，您可以搭建出一个便捷、易用、安全的数据湖架构。在数据湖架构设计中，通常会...

Delta Lake概述

Delta Lake以数据为中心，围绕数据流走向（数据从流入数据湖、数据组织管理和数据查询到流出数据湖）推出了一系列功能特性，协助您搭配第三方上下游工具，搭建快捷、易用和安全的数据湖。背景信息通常的数据湖方案是选取大数据存储引擎...

ActionTrail日志清洗

DLA提供ActionTrail日志自动清洗解决方案，可以将ActionTrail投递到OSS的日志文件转换为DLA中可以直接查询的数据表，同时自动对数据进行分区和压缩，方便您分析和审计对云产品的操作日志。日志分析痛点 ActionTrail是阿里云提供的云账号...

周期任务补数据

如果主键或来源表未发生变更，您可以选择全表补数据模式或指定字段补数据模式：全表：适用于数据表的所有字段都需要补数据的场景。说明不包括注册上挂字段。指定字段：适用于需要自定义补数据的字段的场景，受到如下约束：有变更字段：...

周期任务补数据

如果主键或来源表未发生变更，您可以选择全表补数据模式或指定字段补数据模式：全表：适用于数据表的所有字段都需要补数据的场景。说明不包括注册上挂字段。指定字段：适用于需要自定义补数据的字段的场景，受到如下约束：有变更字段：...

账单数据订阅及查询分析

步骤二：订阅账单数据在 大数据分析>数据订阅管理区域，根据需要订阅相应账单数据，订阅后，相关账单数据会同步至指定的MaxCompute表。说明该操作需要当前登录账号为账单分析指定的DataWorks工作空间（即步骤一中，由平台统一创建的工作...

东软案例

在互联网服务场景下，运维监控数据量激增，采集监控的数据类型更加多样（时序指标、日志、代码链路等），现有运维系统采用的单模引擎（如RRD数据库、openTSDB时序数据库、ElasticSearch检索类数据库）应对这些实时、高并发采集，且价值密度...

混合存储型（已停售）

反之，在内存命中率较低，甚至所有访问都需要从磁盘读取数据的情况下，混合存储型实例的性能将达到低谷。在如下的三个测试场景中，Tair实例储存了总数2千万的Key，Value大小均为1 KB。测试方式为使用 GET 命令获取Value，三个场景的访问...

简介

HBase Ganos是什么 HBase Ganos是阿里云推出的一款包含管理空间几何数据、时空轨迹、专题栅格、遥感影像的时空大数据引擎系统。系统兼容开源GeoMesa、GeoServer等生态，内置了高效的时空索引算法、空间拓扑几何算法、遥感影像处理算法等，...

确定需求

您在构建数据仓库之前，首先需要确定构建数据仓库的目标与需求，并进行全面的业务调研。您需要了解真实的业务需求，以及确定数据仓库要解决的问题。业务调研充分的业务调研和需求分析是数据仓库建设的基石，直接决定数据仓库能否建设成功...

管理内置数据集

常见问题 Q：加载内置数据集集群需要满足什么条件？A：至少购买24 ACU的存储预留资源，且user_default资源组中至少有16 ACU的计算预留资源。Q：如何判断内置数据集是否加载成功？A：在作业开发>SQL开发页面可查看加载进度。当加载内置...

数据加工过程卡点校验

为保障线上数据的准确性，每次变更都需要经过测试再发布到线上生产环境，且生产环境测试通过后才算发布成功。任务变更或数据重跑。在进行更新操作前，需要通知下游变更原因、变更逻辑、变更时间等信息。下游对此次变更没有异议后，再按照...

确定需求

您在构建数据仓库之前，首先需要确定构建数据仓库的目标与需求，并进行全面的业务调研。您需要了解真实的业务需求，以及确定数据仓库要解决的问题。业务调研充分的业务调研和需求分析是数据仓库建设的基石，直接决定数据仓库能否建设成功...

补数据

周、月任务如何执行补数据操作补数据功能说明补数据支持补历史一段时间区间的数据或者需要补未来一段时间的数据时，可以选择补数据功能。节点使用的调度参数会根据补数据选择的业务时间自动替换为对应的值。将MySQL增量数据写入...

常见问题

为什么Redis内存报警与监控的内存使用率不一致如何解决Redis内存使用率突然升高如何搜索大Key 查看Redis集群实例的架构图和监控数据查看Redis集群子实例内存查看当前账号所有实例内存的使用信息使用memtier-benchmark测试Redis集群版...

技术发展趋势

传统大数据技术可以满足此类需求，但其发散的技术栈，不统一的使用习惯，都难以在广大企业内落地使用。因此急需统一、标准化的技术解决方案。数据加速上云 Gartner预测到2023年，所有数据库中75%将放在云平台上。企业机构正在云中部署新的...

JindoFS介绍和使用

JindoFS是基于阿里云对象存储OSS，为开源大数据生态构建的Hadoop兼容文件系统（Hadoop Compatible File System，HCFS）。JindoFS提供兼容对象存储的纯客户端模式（SDK）和缓存模式（Cache），以支持与优化Hadoop和Spark生态大数据计算对OSS...

Catalog概述

本文为您介绍什么是Catalog（数据目录），以及如何使用Catalog查询内外部数据。基本概念内部数据：保存在StarRocks中的数据。外部数据：保存在外部数据源（例如，Apache Hive、Apache Iceberg和Apache Hudi）中的数据。Catalog StarRocks ...

编辑数据源

数据源添加完成之后，您可以根据大屏展示的需要，编辑数据源的内容。推荐在画布编辑页面编辑数据源。除了可以编辑数据源，还可以在该页面完成数据映射、添加过滤器和设定数据自动更新时间。操作步骤登录 DataV控制台。参考使用模板...

什么是云原生数据湖分析

支持 AnalyticDB PostgreSQL 支持支持 MaxCompute 支持支持 Elasticsearch 支持支持 Cassandra 支持支持 Kudu 支持支持 ECS自建Druid数据库数据支持支持何时使用DLA DLA主要围绕数据湖存储OSS提供一站式的云原生数据湖分析与计算...

产品概述

什么是全密态数据库全密态数据库是数据库与存储实验室与阿里云数据库团队合作的自研产品，以技术为基石，最小化人员、平台管理等不可控因素造成的潜在数据安全隐患，可以有效杜绝云数据库服务（或应用服务等数据拥有者以外的任何人）接触...

产品概述

什么是全密态数据库全密态数据库是数据库与存储实验室与阿里云数据库团队合作的自研产品，以技术为基石，最小化人员、平台管理等不可控因素造成的潜在数据安全隐患，可以有效杜绝云数据库服务（或应用服务等数据拥有者以外的任何人）接触...

离线同步并发和限流之间的关系

问题三：为什么数据同步任务运行速率有时候相较限速阈值有较大差距？同步速率：数据同步速率和任务期望最大并发数是比较强相关的参数，两者结合在一起可以保护数据来源和数据去向端的读写压力，以避免数据同步任务对数据源带来较大压力，...

常见问题

Q：数据什么时候进入冷存储？A：Lindorm通过 compaction 机制异步将冷数据从热存储归档至冷存储，系统触发时间默认为冷热分界线的一半，最小为1天，最大为 major compaction 周期的一半，major compaction 周期默认为20天。例如，冷热分界...

产品概述

什么是全密态数据库全密态数据库是达摩院数据库与存储实验室与阿里云数据库团队合作的自研产品，以技术为基石，最小化人员、平台管理等不可控因素造成的潜在数据安全隐患，可以有效杜绝云数据库服务（或应用服务等数据拥有者以外的任何...

大数据AI公共数据集分析

本教程通过DataWorks，联合云原生大数据计算服务MaxCompute，使用大数据AI公共数据集（淘宝、飞猪、阿里音乐、Github、TPC等公共数据），指导您如何快速进行大数据分析，快速熟悉DataWorks的操作界面与最基础的数据分析能力。DataWorks的更...

常见问题

数据安全中心DSC根据为不同行业预先定义的敏感数据关键字段，扫描MaxCompute、OSS、阿里云数据库服务（RDS、PolarDB-X、PolarDB、OceanBase、表格存储等）和自建数据库中的数据，通过敏感数据规则，判断和打标敏感数据，为数据安全审计、...

创建Hologres数据源

新建Hologres数据源用于实现Dataphin能够读取Hologres的业务数据，及能够向Hologres写入数据。在引入Hologres的业务数据至Dataphin和将Dataphin的数据写入至Hologres的场景中，您需要先创建Hologres数据源。本文为您介绍如何新建Hologres...

创建MaxCompute数据源

背景信息 MaxCompute即阿里云大数据计算服务，适用于数据分析场景的企业级SaaS（Software as a Service）模式云数据仓库，以Serverless架构提供快速、全托管的在线数据仓库服务，消除了传统数据平台在资源扩展性和弹性方面的限制，最小化...

索引优化

大数据集场景下优先考虑稀疏索引：如果您的数据量非常地大，并且您的查询限定条件为<、、=、>=、>，需要从大数据量的表中取出少于50%的数据，那么使用稀疏索引（BRIN Index或者AOCS表的metascan）可以极大地减少无效数据的加载。...

Catalog概述

本文为您介绍什么是Catalog（数据目录），以及如何使用Catalog管理和查询内外部数据。基本概念内部数据：保存在StarRocks中的数据。外部数据：保存在外部数据源（例如Apache Hive、Apache Iceberg和Apache Hudi）中的数据。Catalog ...

创建MaxCompute数据源

背景信息 MaxCompute即阿里云大数据计算服务，适用于数据分析场景的企业级SaaS（Software as a Service）模式云数据仓库，以Serverless架构提供快速、全托管的在线数据仓库服务，消除了传统数据平台在资源扩展性和弹性方面的限制，最小化...

EMR数据开发停止更新公告

作为一站式大数据开发治理平台，DataWorks沉淀阿里巴巴十多年大数据建设方法论，为客户完成从入湖、建模、开发、调度、治理、安全等全链路数据湖开发治理能力，帮助客户提升数据的应用效率。迁移流程阿里云DataWorks on EMR团队提供了完善...

整体架构

湖仓版（3.0）在数据全链路的“采存算管用”5大方面都进行了全面升级。湖仓版（3.0）架构如下：数据源数据管道APS可以一键低成本接入数据库、日志、大数据中的数据。存储层+计算层支持自研引擎，羲和计算引擎和玄武存储引擎。新增集成的...

创建Kudu数据源

背景信息 Kudu提供接近于关系数据库管理系统（RDBMS）的功能和数据模型，提供类似于关系型数据库的存储结构来存储数据，允许用户以和关系型数据库相同的方式插入、更新、删除数据。Kudu仅仅是一个存储层，并不存储数据，因此需要依赖外部的...

功能概述

当您的数据库中有数据需要被保护时，可以使用RDS MySQL全密态数据库功能，该功能提供的加密解决方案能够在遵守数据保护法规的前提下保障您的数据安全，使被保护数据免受未授权访问。本文介绍全密态数据库的概念、应用场景和安全分级。什么...

仪表盘

配置图表筛选器大部分图表或组件都可以配置图表筛选器，操作步骤如下：在仪表盘编辑页面选中需要进行配置的图表。在图表配置区域，选择数据配置标签。将需要配置筛选 WHERE 条件的字段从数据集面板拖拽到筛选字段配置区域。单击字段后的...

安全基线检查

数据安全中心通过动态检测数据资产配置的方式，以数据为落脚点检测阿里云上数据库资产是否存在配置风险，例如身份验证、访问控制、加密、备份和恢复等方面的配置是否安全，这些检查策略和检查项统称为安全基线检查。安全基线检查功能可以帮...

大数据工程师都需要懂什么

新品推荐