私は PDFbox を使用して PDF ドキュメント内の単語/文字列の座標を抽出していますが、これまでのところ個々の文字の位置を決定することに成功しています。これは、PDFbox doc からのこれまでのコードです。
package printtextlocations;
import java.io.*;
import org.apache.pdfbox.exceptions.InvalidPasswordException;
import org.apache.pdfbox.pdmodel.PDDocument;
import org.apache.pdfbox.pdmodel.PDPage;
import org.apache.pdfbox.pdmodel.common.PDStream;
import org.apache.pdfbox.util.PDFTextStripper;
import org.apache.pdfbox.util.TextPosition;
import java.io.IOException;
import java.util.List;
public class PrintTextLocations extends PDFTextStripper {
public PrintTextLocations() throws IOException {
public static void main(String[] args) throws Exception {
PDDocument document = null;
try {
File input = new File("C:\\path\\to\\PDF.pdf");
document = PDDocument.load(input);
if (document.isEncrypted()) {
try {
} catch (InvalidPasswordException e) {
System.err.println("Error: Document is encrypted with a password.");
PrintTextLocations printer = new PrintTextLocations();
List allPages = document.getDocumentCatalog().getAllPages();
for (int i = 0; i < allPages.size(); i++) {
PDPage page = (PDPage) allPages.get(i);
System.out.println("Processing page: " + i);
PDStream contents = page.getContents();
if (contents != null) {
printer.processStream(page, page.findResources(), page.getContents().getStream());
} finally {
if (document != null) {
* @param text The text to be processed
@Override /* this is questionable, not sure if needed... */
protected void processTextPosition(TextPosition text) {
System.out.println("String[" + text.getXDirAdj() + ","
+ text.getYDirAdj() + " fs=" + text.getFontSize() + " xscale="
+ text.getXScale() + " height=" + text.getHeightDir() + " space="
+ text.getWidthOfSpace() + " width="
+ text.getWidthDirAdj() + "]" + text.getCharacter());
String[202.5604,41.880127 fs=1.0 xscale=13.98 height=9.68814 space=3.8864403 width=9.324661]P
「P」は文字です。私は PDFbox で単語を検索する関数を見つけることができませんでした。また、スペースも含まれていても、これらの文字を単語に正確に連結して検索できるほど Java に精通していません。他の誰かが同様の状況にありましたか? もしそうなら、どのようにアプローチしましたか? 部分を単純化するために、単語の最初の文字の座標だけが本当に必要ですが、そのような出力に対して文字列をどのように一致させるかについては、私を超えています。