4

スクレイピーのドキュメントを読んだ後、HttpProxyMiddleware がデフォルトで有効になっていると思いました。しかし、scrapyd の Web サービス インターフェイスを介してスパイダーを起動すると、HttpProxyMiddleware が有効になりません。次の出力が表示されます。

2013-02-18 23:51:01+1300 [scrapy] INFO: Scrapy 0.17.0-120-gf293d08 started (bot: pde)
2013-02-18 23:51:02+1300 [scrapy] DEBUG: Enabled extensions: FeedExporter, LogStats, CloseSpider, WebService, CoreStats, SpiderState
2013-02-18 23:51:02+1300 [scrapy] DEBUG: Enabled downloader middlewares: HttpAuthMiddleware, DownloadTimeoutMiddleware, UserAgentMiddleware, RetryMiddleware, DefaultHeadersMiddleware, MetaRefreshMiddleware, HttpCompressionMiddleware, RedirectMiddleware, CookiesMiddleware, ChunkedTransferMiddleware, DownloaderStats
2013-02-18 23:51:02+1300 [scrapy] DEBUG: Enabled spider middlewares: HttpErrorMiddleware, OffsiteMiddleware, RefererMiddleware, UrlLengthMiddleware, DepthMiddleware
2013-02-18 23:51:02+1300 [scrapy] DEBUG: Enabled item pipelines: PdePipeline
2013-02-18 23:51:02+1300 [shotgunsupplements] INFO: Spider opened

HttpProxyMiddleware が有効になっていないことに注意してください。Scrapyd で有効にするにはどうすればよいですか? どんな助けでも大歓迎です。

私のscrapy.cfg

# Automatically created by: scrapy startproject
#
# For more information about the [deploy] section see:
# http://doc.scrapy.org/topics/scrapyd.html

[settings]
default = pd.settings

[deploy]
url = http://localhost:6800/
project = pd

私は次のsettings.pyを持っています

BOT_NAME = 'pd' #this gets replaced with a function
BOT_VERSION = '1.0'

SPIDER_MODULES = ['pd.spiders']
NEWSPIDER_MODULE = 'pd.spiders'
DEFAULT_ITEM_CLASS = 'pd.items.Product'
ITEM_PIPELINES = 'pd.pipelines.PdPipeline'
USER_AGENT = '%s/%s' % (BOT_NAME, BOT_VERSION)

TELNETCONSOLE_HOST = '127.0.0.1' # defaults to 0.0.0.0 set so
TELNETCONSOLE_PORT = '6073'      # only we can see it.
TELNETCONSOLE_ENABLED = False

WEBSERVICE_ENABLED = True

LOG_ENABLED = True


ROBOTSTXT_OBEY = False
ITEM_PIPELINES = [
    'pd.pipelines.PdPipeline',
    ]

DATA_DIR = '/home/pd/scraped_data' #directory to store export files to.

DOWNLOAD_DELAY = 2.0

DOWNLOADER_MIDDLEWARES = {
    'scrapy.contrib.downloadermiddleware.httpproxy.HttpProxyMiddleware': 750,
}

よろしく、

プランシュ

4

1 に答える 1

8

デバッグに永遠に費やした後、HttpProxyMiddlewareは実際にはhttp_proxy環境変数が設定されることを期待していることがわかりました。http_proxyが設定されていない場合、ミドルウェアはロードされません。したがって、私はhttp_proxyを設定し、bobはあなたのおじです!すべてが機能します!

于 2013-02-19T11:41:06.257 に答える