Apache POI Word - 文本提取
2018-12-27 18:44 更新
本章介绍如何使用Java从Word文档中提取简单文本数据。 如果您想从Word文档中提取元数据,请使用Apache Tika。
对于.docx文件,我们使用类org.apache.poi.xwpf.extractor.XPFFWordExtractor从Word文件中提取和返回简单数据。 同样,我们有不同的方法从Word文件中提取标题,脚注,表数据等。
以下代码显示如何从Word文件提取简单文本:
import java.io.FileInputStream; import org.apache.poi.xwpf.extractor.XWPFWordExtractor; import org.apache.poi.xwpf.usermodel.XWPFDocument; public class WordExtractor { public static void main(String[] args)throws Exception { XWPFDocument docx = new XWPFDocument( new FileInputStream("create_paragraph.docx")); //using XWPFWordExtractor Class XWPFWordExtractor we = new XWPFWordExtractor(docx); System.out.println(we.getText()); } }
将上述代码保存为 WordExtractor.java 。从命令提示符处编译并执行,如下所示:
$javac WordExtractor.java $java WordExtractor
它将生成以下输出:
At tutorialspoint.com, we strive hard to provide quality tutorials for self-learning purpose in the domains of Academics, Information Technology, Management and Computer Programming Languages.
以上内容是否对您有帮助:
更多建议: