基于 aspose.word 的 Java 文档转换项目

本贴最后更新于 2047 天前,其中的信息可能已经天翻地覆

抽象工厂模式设计的一款工具项目,方便快速实现 html 转 PDF、doc 转 PDF 等功能

项目源代码:github/simple-convert

如何使用

  • 使用 Maven 下载依赖

        <dependency>
          <groupId>com.liumapp.simple.convert</groupId>
          <artifactId>simple-convert</artifactId>
          <version>v1.0.0</version>
        </dependency>
    
  • 拷贝 repo 目录到本地项目中,否则会提示找不到 aspose 的 jar 包

    当然,您也可以自行将 libs 目录下的 aspose 这个 jar 包部署到自己的 nexus 私服或者导入 maven 的本地仓库中

  • html 转 doc

    • 通过文件目录转换

          BasicConverter converter = new HtmlToPdfConverterFactory().getInstance();
          String htmlFilePath = HtmlToPdfConverterTest.class.getClassLoader().getResource("test.html").getPath();
          String pdfResultPath = "./result.pdf";
          converter.convertByFilePath(htmlFilePath, pdfResultPath);
      

      执行后将 htmlFilePath 所指向的 html 文件转换为 pdf 文件,并保存在 pdfResultPath 路径下

    • 通过输入流转换

          BasicConverter converter = new HtmlToPdfConverterFactory().getInstance();
          String targetFilePath = HtmlToPdfConverterTest.class.getClassLoader().getResource("test.html").getPath();
          InputStream is = new FileInputStream(targetFilePath);
          OutputStream os = new FileOutputStream(new File("./result2.pdf"));
          converter.convertByStream(is, os);
          os.flush();
          is.close();
          os.close();
      

      将要转换的 html 文件作为输入流输出,输出流为要存储的 pdf 文件输出流,也可以使用 ByteArrayOutputStream 暂存在内存中

    • 通过 base64 转换

          BasicConverter converter = new HtmlToPdfConverterFactory().getInstance();
          String targetFilePath = HtmlToPdfConverterTest.class.getClassLoader().getResource("test.html").getPath();
          InputStream is = new FileInputStream(targetFilePath);
          String inputBase64 = Base64FileTool.inputStreamToBase64(is);
          String resultBase64 = converter.convertByBase64(inputBase64);
          is.close();
      

      inputBase64 为 html 文件内容的 base64 值,输出的 resultBase64 为转换后的 pdf base64 值

    • 直接传入 html 字符串转 pdf 文件

      同通过 base64 转换一样,将 html 字符串加密为 base64 值,将转换后的 base64 解密存储即可得到 pdf 文件

           BasicConverter converter = new HtmlToPdfConverterFactory().getInstance();
           String htmlContents = "<h3>你的第一个html转PDF文档出来啦!!</h3>\n" +
                   "<br>\n" +
                   "<div style=\"color: aquamarine\">\n" +
                   "    注意:html5以及css3的支持还不够完善!!!\n" +
                   "</div>\n";
           String inputBase64 = Base64.getEncoder().encodeToString(htmlContents.getBytes());
           String resultBase64 = converter.convertByBase64(inputBase64);
           Base64FileTool.saveBase64File(resultBase64, "./result10.pdf");
      

      Base64FileTool 这个类来自于 qtools-file 依赖

  • doc 转 pdf

    • 通过文件目录转换

          BasicConverter converter = new DocToPdfConverterFactory().getInstance();
          converter.convertByFilePath("./data/test.doc", "./result4.pdf");
      
    • 通过输入流转换

          BasicConverter converter = new DocToPdfConverterFactory().getInstance();
          FileInputStream is = new FileInputStream("./data/test.doc");
          FileOutputStream os = new FileOutputStream("./result5.pdf");
          converter.convertByStream(is, os);
          is.close();
          os.close();  
      

注意事项

  • 在 pom.xml 中,不要使用 system scope 引入 jar 包,而要通过在项目设立一个 maven 本地仓库:repo 目录,将所需要的第三方 jar 包 deploy 进去(不能直接从 maven 下载,原因你懂的)

    • system scope 引入的包,在使用 jar-with-dependencies 打包时将不会被包含,可以使用 resources 将本地包打进 jar-with-dependencies

    • 关于本地 repositor 的创建和使用,可以参考 这里

  • html 转 PDF 的功能还不够完善,不能完美支持:html5 + css3(或者说能够完美支持 html5 + css3 的破解版本还没有出来)

  • 所有转换默认是以 A4 纸作为最终的 PDF 页面大小,如果要进行更改的话,请直接使用 BasicConverter 的 getDocument 和 getDocumentBuilder 方法,在获取到 Document 对象或者 DocumentBuilder 对象后,修改 pageSetup 的相关属性,具体请参考 aspose 的文档

    或者直接参考这一段代码:

        BasicConverter converter = new HtmlToPdfConverterFactory().getInstance();
        DocumentBuilder builder = converter.getDocumentBuilder();
        PageSetup pageSetup = builder.getPageSetup();
        pageSetup.setPageWidth(2000);
        pageSetup.setPageHeight(100);
        String htmlFilePath = HtmlToPdfConverterTest.class.getClassLoader().getResource("test.html").getPath();
        String pdfResultPath = "./result11.pdf";
        converter.convertByFilePath(htmlFilePath, pdfResultPath);
        assertEquals(true, FileTool.isFileExists("./result11.pdf"));
    
  • Java

    Java 是一种可以撰写跨平台应用软件的面向对象的程序设计语言,是由 Sun Microsystems 公司于 1995 年 5 月推出的。Java 技术具有卓越的通用性、高效性、平台移植性和安全性。

    3187 引用 • 8213 回帖

相关帖子

欢迎来到这里!

我们正在构建一个小众社区,大家在这里相互信任,以平等 • 自由 • 奔放的价值观进行分享交流。最终,希望大家能够找到与自己志同道合的伙伴,共同成长。

注册 关于
请输入回帖内容 ...
liumapp
Github: https://github.com/liumapp 杭州

推荐标签 标签

  • WebComponents

    Web Components 是 W3C 定义的标准,它给了前端开发者扩展浏览器标签的能力,可以方便地定制可复用组件,更好的进行模块化开发,解放了前端开发者的生产力。

    1 引用
  • C++

    C++ 是在 C 语言的基础上开发的一种通用编程语言,应用广泛。C++ 支持多种编程范式,面向对象编程、泛型编程和过程化编程。

    107 引用 • 153 回帖
  • wolai

    我来 wolai:不仅仅是未来的云端笔记!

    2 引用 • 14 回帖
  • Openfire

    Openfire 是开源的、基于可拓展通讯和表示协议 (XMPP)、采用 Java 编程语言开发的实时协作服务器。Openfire 的效率很高,单台服务器可支持上万并发用户。

    6 引用 • 7 回帖 • 94 关注
  • RIP

    愿逝者安息!

    8 引用 • 92 回帖 • 351 关注
  • 京东

    京东是中国最大的自营式电商企业,2015 年第一季度在中国自营式 B2C 电商市场的占有率为 56.3%。2014 年 5 月,京东在美国纳斯达克证券交易所正式挂牌上市(股票代码:JD),是中国第一个成功赴美上市的大型综合型电商平台,与腾讯、百度等中国互联网巨头共同跻身全球前十大互联网公司排行榜。

    14 引用 • 102 回帖 • 376 关注
  • 机器学习

    机器学习(Machine Learning)是一门多领域交叉学科,涉及概率论、统计学、逼近论、凸分析、算法复杂度理论等多门学科。专门研究计算机怎样模拟或实现人类的学习行为,以获取新的知识或技能,重新组织已有的知识结构使之不断改善自身的性能。

    83 引用 • 37 回帖 • 1 关注
  • 面试

    面试造航母,上班拧螺丝。多面试,少加班。

    325 引用 • 1395 回帖
  • TGIF

    Thank God It's Friday! 感谢老天,总算到星期五啦!

    287 引用 • 4484 回帖 • 669 关注
  • V2EX

    V2EX 是创意工作者们的社区。这里目前汇聚了超过 400,000 名主要来自互联网行业、游戏行业和媒体行业的创意工作者。V2EX 希望能够成为创意工作者们的生活和事业的一部分。

    17 引用 • 236 回帖 • 327 关注
  • GAE

    Google App Engine(GAE)是 Google 管理的数据中心中用于 WEB 应用程序的开发和托管的平台。2008 年 4 月 发布第一个测试版本。目前支持 Python、Java 和 Go 开发部署。全球已有数十万的开发者在其上开发了众多的应用。

    14 引用 • 42 回帖 • 764 关注
  • 学习

    “梦想从学习开始,事业从实践起步” —— 习近平

    169 引用 • 506 回帖
  • SOHO

    为成为自由职业者在家办公而努力吧!

    7 引用 • 55 回帖 • 19 关注
  • JRebel

    JRebel 是一款 Java 虚拟机插件,它使得 Java 程序员能在不进行重部署的情况下,即时看到代码的改变对一个应用程序带来的影响。

    26 引用 • 78 回帖 • 664 关注
  • 酷鸟浏览器

    安全 · 稳定 · 快速
    为跨境从业人员提供专业的跨境浏览器

    3 引用 • 59 回帖 • 26 关注
  • 区块链

    区块链是分布式数据存储、点对点传输、共识机制、加密算法等计算机技术的新型应用模式。所谓共识机制是区块链系统中实现不同节点之间建立信任、获取权益的数学算法 。

    91 引用 • 751 回帖 • 2 关注
  • 职场

    找到自己的位置,萌新烦恼少。

    127 引用 • 1705 回帖 • 1 关注
  • Gitea

    Gitea 是一个开源社区驱动的轻量级代码托管解决方案,后端采用 Go 编写,采用 MIT 许可证。

    4 引用 • 16 回帖 • 5 关注
  • Unity

    Unity 是由 Unity Technologies 开发的一个让开发者可以轻松创建诸如 2D、3D 多平台的综合型游戏开发工具,是一个全面整合的专业游戏引擎。

    25 引用 • 7 回帖 • 173 关注
  • 前端

    前端技术一般分为前端设计和前端开发,前端设计可以理解为网站的视觉设计,前端开发则是网站的前台代码实现,包括 HTML、CSS 以及 JavaScript 等。

    247 引用 • 1348 回帖
  • JavaScript

    JavaScript 一种动态类型、弱类型、基于原型的直译式脚本语言,内置支持类型。它的解释器被称为 JavaScript 引擎,为浏览器的一部分,广泛用于客户端的脚本语言,最早是在 HTML 网页上使用,用来给 HTML 网页增加动态功能。

    729 引用 • 1327 回帖
  • SEO

    发布对别人有帮助的原创内容是最好的 SEO 方式。

    35 引用 • 200 回帖 • 22 关注
  • 房星科技

    房星网,我们不和没有钱的程序员谈理想,我们要让程序员又有理想又有钱。我们有雄厚的房地产行业线下资源,遍布昆明全城的 100 家门店、四千地产经纪人是我们坚实的后盾。

    6 引用 • 141 回帖 • 585 关注
  • 以太坊

    以太坊(Ethereum)并不是一个机构,而是一款能够在区块链上实现智能合约、开源的底层系统。以太坊是一个平台和一种编程语言 Solidity,使开发人员能够建立和发布下一代去中心化应用。 以太坊可以用来编程、分散、担保和交易任何事物:投票、域名、金融交易所、众筹、公司管理、合同和知识产权等等。

    34 引用 • 367 回帖
  • MySQL

    MySQL 是一个关系型数据库管理系统,由瑞典 MySQL AB 公司开发,目前属于 Oracle 公司。MySQL 是最流行的关系型数据库管理系统之一。

    690 引用 • 535 回帖
  • Sym

    Sym 是一款用 Java 实现的现代化社区(论坛/BBS/社交网络/博客)系统平台。

    下一代的社区系统,为未来而构建

    524 引用 • 4601 回帖 • 700 关注
  • SendCloud

    SendCloud 由搜狐武汉研发中心孵化的项目,是致力于为开发者提供高质量的触发邮件服务的云端邮件发送平台,为开发者提供便利的 API 接口来调用服务,让邮件准确迅速到达用户收件箱并获得强大的追踪数据。

    2 引用 • 8 回帖 • 483 关注