多系统,异构数据,大数据量同步的问题

本贴最后更新于 2397 天前,其中的信息可能已经天翻地覆

最近在做个项目,功能主要是数据同步。
客户有多个系统(OA,AD 域服务器···),各个系统间没有直接连通,这些系统都要用到 HR 系统的员工相关数据(员工信息变更都是在 HR 系统进行),现在要把 HR 系统相关数据同步到其他的系统。不要求实时,但是要求支持增量同步和全量同步,数据量比较多。

请问黑客有没相关方案或者资料可推荐?

  • Java

    Java 是一种可以撰写跨平台应用软件的面向对象的程序设计语言,是由 Sun Microsystems 公司于 1995 年 5 月推出的。Java 技术具有卓越的通用性、高效性、平台移植性和安全性。

    3190 引用 • 8214 回帖 • 1 关注
  • 异构系统
    1 引用 • 8 回帖
  • 数据同步
    1 引用 • 8 回帖
  • 大数据

    大数据(big data)是指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

    93 引用 • 113 回帖

相关帖子

欢迎来到这里!

我们正在构建一个小众社区,大家在这里相互信任,以平等 • 自由 • 奔放的价值观进行分享交流。最终,希望大家能够找到与自己志同道合的伙伴,共同成长。

注册 关于
请输入回帖内容 ...
  • kafka 了解一下

  • 其他回帖
  • shuiniu 1 赞同

    @linker @xjtushilei ,昨天问的问题今天整理了两个方案出来,正在实现中(java web),欢迎讨论:

    场景

    这里对场景进行简化:

    1. 现在有张表:A 和 B,A B 表通过 id 字段关联(A 表掌握在客户手里,不能随便变更结构和数据)
    2. 俩表异构,需要自己根据业务做好字段的对应
    3. 这两张表可能不在同一个数据库
    4. 用户只对 A 进行人为操作,其中 增删改 操作的结果需要同步到 B 表
    5. 不要求实时,要求准确可靠,增量更新,并且数据量大

    分析

    增量更新必须要有相应的字段支持,否则除了行间内容的全量对比(成本高效率低),别无他法。

    增量同步的两个先决条件:

    1. A 表需要一个记录内容的 最后修改时间 的字段,假设该字段名是 modifyTime
    2. B 表需要一个记录内容的 最后同步时间 的字段,假设该字段名是 syncTime

    一些方案

    方案一

    查询出 B 表的最小 syncTime(minSync) ,分页查出 A 表 modifyTime>=minSync (上次同步完之后进行了修改) 的记录进行同步或者插入,直到所有的 modifyTime<minSync 。

    方案二

    分页从 A 表取出 id 和 modifyTime,在 B 系统中做关联对比,syncTime<=modifyTime 的记录需要更新,B 表中没有的记录则执行插入。

    注意:考虑到不同机器的时间有一些误差,需要做一些处理,避免都写出在临界值的记录没有得到更新,比如:modifyTime>=minSync-N (N 是机器间时间差和其他的时间开销产生的误差)

    以上两种方案的优缺点,暂时没有总结整理。

  • xjtushilei

    👍

  • xjtushilei 2 3 赞同

    全量

    全量数据的话用阿里的 datax,官网 https://github.com/alibaba/DataX,应该没有任何问题

    增量

    这个比较复杂了,要看具体任务具体设计了。不知道符合以下哪种情况。

    1. 如果有公网 ip 的话可以试试阿里的 dts,不过大概率数据库不会有公网权限的
      imagepng
    2. 如果有增量的 id,时间戳之类的,自己写脚本去实现增量读取就好。判断源 db 和目标 db 的 id 大小,速度和同步时间都可以自己控制,不影响原来系统业务性能。还能体现出自己的 kpi
    3. 如果有源 DB 的权限
    4. 基于 binlog,用类似 flume 或 Logstash 之类的去监测 binlog,然后增量的 binlog 刷到目标 db,目标 db 有压力的话中间搞个 kafka 之类的消息队列来缓冲一下,再用 flume 接上你的目标 db
    5. 基于触发器,设置 insert,update,delete 的触发器,执行脚本。脚本刷到 kafka 之类的队列里,然后 kafka 再到目标 db(可以再用 flume 来完成这个任务,省去自己写程序)
    6. 还有一个比较万能的软件,在用 datax 之前了解过,但是没用过,希望对你有用。kettle 据说有很多种方式来满足需求。
    1 回复
  • 查看全部回帖

推荐标签 标签

  • Postman

    Postman 是一款简单好用的 HTTP API 调试工具。

    4 引用 • 3 回帖 • 7 关注
  • ZooKeeper

    ZooKeeper 是一个分布式的,开放源码的分布式应用程序协调服务,是 Google 的 Chubby 一个开源的实现,是 Hadoop 和 HBase 的重要组件。它是一个为分布式应用提供一致性服务的软件,提供的功能包括:配置维护、域名服务、分布式同步、组服务等。

    59 引用 • 29 回帖 • 14 关注
  • 学习

    “梦想从学习开始,事业从实践起步” —— 习近平

    171 引用 • 512 回帖
  • JWT

    JWT(JSON Web Token)是一种用于双方之间传递信息的简洁的、安全的表述性声明规范。JWT 作为一个开放的标准(RFC 7519),定义了一种简洁的,自包含的方法用于通信双方之间以 JSON 的形式安全的传递信息。

    20 引用 • 15 回帖 • 6 关注
  • C++

    C++ 是在 C 语言的基础上开发的一种通用编程语言,应用广泛。C++ 支持多种编程范式,面向对象编程、泛型编程和过程化编程。

    107 引用 • 153 回帖
  • Love2D

    Love2D 是一个开源的, 跨平台的 2D 游戏引擎。使用纯 Lua 脚本来进行游戏开发。目前支持的平台有 Windows, Mac OS X, Linux, Android 和 iOS。

    14 引用 • 53 回帖 • 538 关注
  • 宕机

    宕机,多指一些网站、游戏、网络应用等服务器一种区别于正常运行的状态,也叫“Down 机”、“当机”或“死机”。宕机状态不仅仅是指服务器“挂掉了”、“死机了”状态,也包括服务器假死、停用、关闭等一些原因而导致出现的不能够正常运行的状态。

    13 引用 • 82 回帖 • 59 关注
  • 机器学习

    机器学习(Machine Learning)是一门多领域交叉学科,涉及概率论、统计学、逼近论、凸分析、算法复杂度理论等多门学科。专门研究计算机怎样模拟或实现人类的学习行为,以获取新的知识或技能,重新组织已有的知识结构使之不断改善自身的性能。

    83 引用 • 37 回帖
  • Swagger

    Swagger 是一款非常流行的 API 开发工具,它遵循 OpenAPI Specification(这是一种通用的、和编程语言无关的 API 描述规范)。Swagger 贯穿整个 API 生命周期,如 API 的设计、编写文档、测试和部署。

    26 引用 • 35 回帖 • 5 关注
  • 房星科技

    房星网,我们不和没有钱的程序员谈理想,我们要让程序员又有理想又有钱。我们有雄厚的房地产行业线下资源,遍布昆明全城的 100 家门店、四千地产经纪人是我们坚实的后盾。

    6 引用 • 141 回帖 • 584 关注
  • App

    App(应用程序,Application 的缩写)一般指手机软件。

    91 引用 • 384 回帖 • 2 关注
  • 自由行
    4 关注
  • Sym

    Sym 是一款用 Java 实现的现代化社区(论坛/BBS/社交网络/博客)系统平台。

    下一代的社区系统,为未来而构建

    524 引用 • 4601 回帖 • 700 关注
  • iOS

    iOS 是由苹果公司开发的移动操作系统,最早于 2007 年 1 月 9 日的 Macworld 大会上公布这个系统,最初是设计给 iPhone 使用的,后来陆续套用到 iPod touch、iPad 以及 Apple TV 等产品上。iOS 与苹果的 Mac OS X 操作系统一样,属于类 Unix 的商业操作系统。

    85 引用 • 139 回帖
  • Log4j

    Log4j 是 Apache 开源的一款使用广泛的 Java 日志组件。

    20 引用 • 18 回帖 • 29 关注
  • TensorFlow

    TensorFlow 是一个采用数据流图(data flow graphs),用于数值计算的开源软件库。节点(Nodes)在图中表示数学操作,图中的线(edges)则表示在节点间相互联系的多维数据数组,即张量(tensor)。

    20 引用 • 19 回帖 • 1 关注
  • NGINX

    NGINX 是一个高性能的 HTTP 和反向代理服务器,也是一个 IMAP/POP3/SMTP 代理服务器。 NGINX 是由 Igor Sysoev 为俄罗斯访问量第二的 Rambler.ru 站点开发的,第一个公开版本 0.1.0 发布于 2004 年 10 月 4 日。

    313 引用 • 547 回帖 • 1 关注
  • Hprose

    Hprose 是一款先进的轻量级、跨语言、跨平台、无侵入式、高性能动态远程对象调用引擎库。它不仅简单易用,而且功能强大。你无需专门学习,只需看上几眼,就能用它轻松构建分布式应用系统。

    9 引用 • 17 回帖 • 612 关注
  • SVN

    SVN 是 Subversion 的简称,是一个开放源代码的版本控制系统,相较于 RCS、CVS,它采用了分支管理系统,它的设计目标就是取代 CVS。

    29 引用 • 98 回帖 • 694 关注
  • Latke

    Latke 是一款以 JSON 为主的 Java Web 框架。

    71 引用 • 535 回帖 • 789 关注
  • WordPress

    WordPress 是一个使用 PHP 语言开发的博客平台,用户可以在支持 PHP 和 MySQL 数据库的服务器上架设自己的博客。也可以把 WordPress 当作一个内容管理系统(CMS)来使用。WordPress 是一个免费的开源项目,在 GNU 通用公共许可证(GPLv2)下授权发布。

    66 引用 • 114 回帖 • 223 关注
  • Solo

    Solo 是一款小而美的开源博客系统,专为程序员设计。Solo 有着非常活跃的社区,可将文章作为帖子推送到社区,来自社区的回帖将作为博客评论进行联动(具体细节请浏览 B3log 构思 - 分布式社区网络)。

    这是一种全新的网络社区体验,让热爱记录和分享的你不再感到孤单!

    1435 引用 • 10056 回帖 • 489 关注
  • CSDN

    CSDN (Chinese Software Developer Network) 创立于 1999 年,是中国的 IT 社区和服务平台,为中国的软件开发者和 IT 从业者提供知识传播、职业发展、软件开发等全生命周期服务,满足他们在职业发展中学习及共享知识和信息、建立职业发展社交圈、通过软件开发实现技术商业化等刚性需求。

    14 引用 • 155 回帖
  • Git

    Git 是 Linux Torvalds 为了帮助管理 Linux 内核开发而开发的一个开放源码的版本控制软件。

    209 引用 • 358 回帖 • 1 关注
  • 分享

    有什么新发现就分享给大家吧!

    248 引用 • 1795 回帖
  • 百度

    百度(Nasdaq:BIDU)是全球最大的中文搜索引擎、最大的中文网站。2000 年 1 月由李彦宏创立于北京中关村,致力于向人们提供“简单,可依赖”的信息获取方式。“百度”二字源于中国宋朝词人辛弃疾的《青玉案·元夕》词句“众里寻他千百度”,象征着百度对中文信息检索技术的执著追求。

    63 引用 • 785 回帖 • 164 关注
  • BookxNote

    BookxNote 是一款全新的电子书学习工具,助力您的学习与思考,让您的大脑更高效的记忆。

    笔记整理交给我,一心只读圣贤书。

    1 引用 • 1 回帖