透明なテキストは実際にはまったく透明ではなく、代わりに画像で覆われているだけであることが判明しました。 TC ロゴを表示します。
以下は、画像で覆われたテキストを無視するテキスト ストリッパー クラスの概念実証を示しています。
public class VisibleTextStripper extends PDFTextStripper
public VisibleTextStripper() throws IOException
registerOperatorProcessor("Do", new Invoke());
// Hiding operations
void hide(String name)
Matrix ctm = getGraphicsState().getCurrentTransformationMatrix();
float x = ctm.getXPosition();
float y = ctm.getYPosition();
float scaledWidth = ctm.getXScale();
float scaledHeight = ctm.getYScale();
for(List<TextPosition> characters : charactersByArticle)
Collection<TextPosition> toRemove = new ArrayList<TextPosition>();
for (TextPosition character : characters)
Matrix matrix = character.getTextPos();
float cx = matrix.getXPosition();
float cy = matrix.getYPosition();
float cw = character.getWidth();
float ch = character.getHeight();
if (overlaps(x, scaledWidth, cx, cw) && overlaps(y, scaledHeight, cy, cw))
System.out.printf("Hidden by '%s': X: %f; Y: %f; Width: %f; Height: %f; Char: '%s'\n", name, cx, cy, cw, ch, character.getCharacter());
private boolean overlaps(float start1, float width1, float start2, float width2)
if (width1 < 0)
start1 += width1;
width1 = -width1;
if (width2 < 0)
start2 += width2;
width2 = -width2;
if (start1 < start2)
return start1 + width1 >= start2;
return start2 + width2 >= start1;
// operator processors
public static class Invoke extends OperatorProcessor
* Log instance.
private static final Log LOG = LogFactory.getLog(Invoke.class);
* process : Do : Paint the specified XObject (section 4.7).
* @param operator The operator that is being executed.
* @param arguments List
* @throws IOException If there is an error invoking the sub object.
public void process(PDFOperator operator, List<COSBase> arguments) throws IOException
VisibleTextStripper drawer = (VisibleTextStripper)context;
COSName objectName = (COSName)arguments.get( 0 );
Map<String, PDXObject> xobjects = drawer.getResources().getXObjects();
PDXObject xobject = (PDXObject)xobjects.get( objectName.getName() );
if ( xobject == null )
LOG.warn("Can't find the XObject for '"+objectName.getName()+"'");
else if( xobject instanceof PDXObjectImage )
else if(xobject instanceof PDXObjectForm)
PDXObjectForm form = (PDXObjectForm)xobject;
COSStream formContentstream = form.getCOSStream();
// if there is an optional form matrix, we have to map the form space to the user space
Matrix matrix = form.getMatrix();
if (matrix != null)
Matrix xobjectCTM = matrix.multiply( context.getGraphicsState().getCurrentTransformationMatrix());
// find some optional resources, instead of using the current resources
PDResources pdResources = form.getResources();
context.processSubStream( context.getCurrentPage(), pdResources, formContentstream );
if (overlaps(x, scaledWidth, cx, cw) && overlaps(y, scaledHeight, cy, cw))
残念ながら、テキストも画像も、回転 (すべての変換が集約されたもの) が含まれていないと仮定しています。
一般的な解決策として、このテストを、 によって変換された 1x1 の正方形が、幅と高さが固定さMatrix ctm = getGraphicsState().getCurrentTransformationMatrix()
れた によって変換された文字ボックスと重なるかどうかをチェックするものに変更する必要があります。また、単純なオーバーラップでは不十分で、文字ボックスを十分にカバーしたい場合があります。Matrix matrix = character.getTextPos()
cw = character.getWidth()
ch = character.getHeight()