import re from scrapy import Spider from scrapy.http import Request from scrapy.selector import Selector from scrapy.spiders import CrawlSpider from jikexueyuan.items import JikexueyuanItem
defget_course_page(self, response): x_course = Selector(text=response.body).xpath("//ul/li/div[@class='text-box']/h2/a") for x in x_course: try: href = x.xpath('@href').extract()[0] title = x.xpath('text()').extract()[0]
meta = {} meta['href'] = href meta['title'] = title yield Request(href, callback=self.get_down_urls, meta={'meta': meta}, cookies=self.cookies) except: pass