java 处理word,excel,pdf -javacode
2008年08月27日 星期三 01:08 P.M.
java 处理word,excel,pdf -javacode
很多人问到如何抽取word,excel,pdf阿。这里我总结一下抽取word,pdf的 几种方法。 1。用jacob. 其实jacob是一个bridage,连接java和com或者win32函数的一个中间件,jacob并不能直接抽取word,excel等文件,需要自己写dll哦,不过已经有为你写好的了,就是jacob的作者一并提供了。 jacob下载: http://www.java-cn.com/technology/tech_downs/1880_001.zip 下载了jacob并放到指定的路径之后(dll放到path,jar文件放到classpath),就可以写你自己的抽取程序了,下面是一个例子: import java.io.File; import com.jacob.com.*; import com.jacob.activeX.*;
public class FileExtracter{
public static void main(String[] args) {
ActiveXComponent app = new ActiveXComponent("Word.Application"); String inFile = "c: est.doc"; String tpFile = "c: emp.htm"; String otFile = "c: emp.xml"; boolean flag = false; try { app.setProperty("Visible", new Variant(false)); Object docs = app.getProperty("document.").toDispatch(); Object doc = Dispatch.invoke(docs,"Open", Dispatch.Method, new Object[]{inFile,new Variant(false), new Variant(true)}, new int[1]).toDispatch(); Dispatch.invoke(doc,"SaveAs", Dispatch.Method, new Object[]{tpFile,new Variant(8)}, new int[1]); Variant f = new Variant(false); Dispatch.call(doc, "Close", f); flag = true; } catch (Exception e) { e.printStackTrace(); } finally { app.invoke("Quit", new Variant[] {}); }
} } 2。用apache的poi来抽取word,excel。 poi是apache的一个项目,不过就算用poi你可能都觉得很烦,不过不要紧,这里提供了更加简单的一个接口给你: 下载经过封装后的poi包: http://www.java-cn.com/technology/tech_downs/1880_002.zip 下载之后,放到你的classpath就可以了,下面是如何使用它的一个例子: import java.io.*; import org.textmining.text.extraction.WordExtractor; /** * <p>Title: pdf extraction</p> * <p>Description: email:chris@matrix.org.cn</p> * <p>Copyright: Matrix Copyright (c) 2003</p> * <p>Company: Matrix.org.cn</p> * @author chris * @version 1.0,who use this example pls remain the declare */
public class PdfExtractor { public PdfExtractor() { } public static void main(String args[]) throws Exception { FileInputStream in = new FileInputStream ("c:a.doc"); WordExtractor extractor = new WordExtractor(); String str = extractor.extractText(in); System.out.println("the result length is"+str.length()); System.out.println("the result is"+str); } }
3。pdfbox-用来抽取pdf文件 但是pdfbox对中文支持还不好,先下载pdfbox: http://www.java-cn.com/technology/tech_downs/1880_003.zip 下面是一个如何使用pdfbox抽取pdf文件的例子: import org.pdfbox.pdmodel.PDdocument. import org.pdfbox.pdfparser.PDFParser; import java.io.*; import org.pdfbox.util.PDFTextStripper; import java.util.Date; /** * <p>Title: pdf extraction</p> * <p>Description: email:chris@matrix.org.cn</p> * <p>Copyright: Matrix Copyright (c) 2003</p> * <p>Company: Matrix.org.cn</p> * @author chris * @version 1.0,who use this example pls remain the declare */
public class PdfExtracter{
public PdfExtracter(){ } public String GetTextFromPdf(String filename) throws Exception { String temp=null; PDdocument.nbsppdfdocument.null; FileInputStream is=new FileInputStream(filename); PDFParser parser = new PDFParser( is ); parser.parse(); pdfdocument.nbsp= parser.getPDdocument.); ByteArrayOutputStream out = new ByteArrayOutputStream(); OutputStreamWriter writer = new OutputStreamWriter( out ); PDFTextStripper stripper = new PDFTextStripper(); stripper.writeText(pdfdocument.getdocument.), writer ); writer.close(); byte[] contents = out.toByteArray();
String ts=new String(contents); System.out.println("the string length is"+contents.length+" "); return ts; } public static void main(String args[]) { PdfExtracter pf=new PdfExtracter(); PDdocument.nbsppdfdocument.nbsp= null;
try{ String ts=pf.GetTextFromPdf("c:a.pdf"); System.out.println(ts); } catch(Exception e) { e.printStackTrace(); } }
}
4.抽取支持中文的pdf文件-xpdf xpdf是一个开源项目,我们可以调用他的本地方法来实现抽取中文pdf文件。 下载xpdf函数包: http://www.java-cn.com/technology/tech_downs/1880_004.zip 同时需要下载支持中文的补丁包: http://www.java-cn.com/technology/tech_downs/1880_005.zip 按照readme放好中文的patch,就可以开始写调用本地方法的java程序了 下面是一个如何调用的例子: import java.io.*; /** * <p>Title: pdf extraction</p> * <p>Description: email:chris@matrix.org.cn</p> * <p>Copyright: Matrix Copyright (c) 2003</p> * <p>Company: Matrix.org.cn</p> * @author chris * @version 1.0,who use this example pls remain the declare */
public class PdfWin { public PdfWin() { } public static void main(String args[]) throws Exception { String PATH_TO_XPDF="C:Program Filesxpdfpdftotext.exe"; String filename="c:a.pdf"; String[] cmd = new String[] { PATH_TO_XPDF, "-enc", "UTF-8", "-q", filename, "-"}; Process p = Runtime.getRuntime().exec(cmd); BufferedInputStream bis = new BufferedInputStream(p.getInputStream()); InputStreamReader reader = new InputStreamReader(bis, "UTF-8"); StringWriter out = new StringWriter(); char [] buf = new char[10000]; int len; while((len = reader.read(buf))>= 0) { //out.write(buf, 0, len); System.out.println("the length is"+len); } reader.close(); String ts=new String(buf); System.out.println("the str is"+ts); } }
http://hi.baidu.com/stq1102/blog
http://hi.baidu.com/xuecj/blog/item/37b5938b6f1b75d6fd1f103e.html
|
分享到:
相关推荐
java用的Word转PDF工具jar包,
java OpenOffice wordExcel转换PDF.zip 带jar包
实现word excel ppt转为pdf,并提供转格式后删除原来的文件。(需要使用jcom)
已测试 pdf转 word ppt html 图片 txt excel 无水印 无页数限制。 使用aspose操作pdf文档,功能强大,学习曲线低,易于掌握 直接下载替换maven库中的jar 或者放在lib下
aspose-word2pdf-15.8.0-jdk.zip
java实现word转pdf 效果及使用教程可以参考 https://blog.csdn.net/u012775558/article/details/121530527
使用maven构建工具。前端使用pdf插件。后台搭建的springmvc框架,主要用于web在线预览pdf、word、excel文件。不需要安装office等其他插件
Aspose.Words Java实现word转pdf文件(高效不失真)。提供license文件。提供源代码。提供jar。下载即可直接使用。Word2PdfUtil.java、license.xml、Aspose.Words-jdk16.jar
JAVA读取WORD_EXCEL_POWERPOINT_PDF文件的方法(poi)
aspose.pdf for java 你懂的,PDF转Excel,附样例程序。在java程序中将可以pdf转为word,excle,txt等,另外还有很多API接口。
Java操作Word, Excel, PDF文档
之前一直在研究java中如何实现word文件生成pdf文件的方法,在网上找了好多,要么是环境问题要么是jar包问题,都没有实现,后来自己专研了一种通过jacob实现的方法。
java文档excel、word、pdf、ppt转图片
java 实现word 转PDF (采用第三方技术 IText、Poi、Jsoup)iText-2.0.8.jar core-renderer.jar iTextAsian.jar iTextAsianCmaps.jar jsoup-1.8.1.jar
(java)aspose实现word转pdf,高清无水印.aspose-words-14.9.0-jdk16.jar 测试正常,图片+表格
java aspose word 转 pdf jar包 try { Document doc = new Document(wordPath); fileOS = new FileOutputStream(new File(pdfFilePath)); // 保存转换的pdf文件 doc.save(fileOS, SaveFormat.PDF); }...
java aspose.word 完美破解无水印无时间限制无长度限制,完美实现word转pdf.本资源仅用于学习aspose技术,切勿用于商业用途. 如有版权纠纷,本人概不负责
大部分不是不支持xls就是不支持换行,或者excel列折页显示,或者不能再linux上显示。 这个接近完美了,包括多个sheet页也都不会出现折行现象。 唯一不足的就是实现代码冗余,并且excel在转换的时候希望不要以放飞...
java使用工具类,word Excel转PDF,消除水印,内含详细使用方法和操作教程
实现word、excel、PPT 转PDF文件功能。去插件水印,添加word、excel、pdf 文字与图片水印功能。执行转化方法前会分别先执行loadLicense()、getLicenseExcel()、getLicensePpt() 加载license.xml文件,不会出现插件...