遗留: 3、网页没有指定编码的情况下,需要采用cpdetector,但目前cpdetector这个在Maven的中央库里面没有,不清楚如何解决。 |
||
---|---|---|
.. | ||
src | ||
README.md | ||
pom.xml |
README.md
webmagic-core
webmagic核心部分。只包含爬虫基本模块和基本抽取器。webmagic-core的目标是成为网页爬虫的一个教科书般的实现。