對(duì)SEO優(yōu)化的深層認(rèn)知SEOER的研究對(duì)象就是搜索引擎,因此深入了解搜索引擎工作原理很有必要,網(wǎng)上也有很多介紹這方面的文章,但能稱得上詳細(xì)、形象、深入地進(jìn)行剖析的少之又少。當(dāng)然,筆者的博文可能也完全達(dá)不到所謂的詳細(xì)、形象、深入三面俱到,但筆者會(huì)盡可能詳盡、深入地闡述各個(gè)原理,以便對(duì)這些原理能有更深層次的認(rèn)知。
一、抓取:其實(shí)在抓取前面還有一個(gè)過(guò)程沒(méi)有描述在內(nèi),那就是爬行,也就是搜索引擎程序發(fā)現(xiàn)新網(wǎng)址的過(guò)程,只是這個(gè)過(guò)程大多伴隨著抓取,除非你的這個(gè)URL上的內(nèi)容沒(méi)有什么價(jià)值(垃圾內(nèi)容、重復(fù)內(nèi)容、文字過(guò)少內(nèi)容等)而被搜索引擎抓取程序直接跳過(guò)。搜索引擎爬行程序以數(shù)據(jù)表中已存在或新提交的鏈接順藤摸瓜式地進(jìn)行爬行以不斷發(fā)現(xiàn)新的URL,抓取程序在分析并確定該URL的頁(yè)面內(nèi)容有價(jià)值后,便將其整個(gè)頁(yè)面抓取下來(lái)放入到龐大的信息數(shù)據(jù)表中。新抓取的內(nèi)容在進(jìn)入信息數(shù)據(jù)表時(shí),并不是一股腦地堆積在那,而是按照信息數(shù)據(jù)庫(kù)中表的字段(如:網(wǎng)頁(yè)URL、title、描述、正文內(nèi)容、抓取時(shí)間、導(dǎo)出鏈接等)分門別類地將信息存儲(chǔ)起來(lái),以便滿足后期的數(shù)據(jù)索引操作。
一、抓取:其實(shí)在抓取前面還有一個(gè)過(guò)程沒(méi)有描述在內(nèi),那就是爬行,也就是搜索引擎程序發(fā)現(xiàn)新網(wǎng)址的過(guò)程,只是這個(gè)過(guò)程大多伴隨著抓取,除非你的這個(gè)URL上的內(nèi)容沒(méi)有什么價(jià)值(垃圾內(nèi)容、重復(fù)內(nèi)容、文字過(guò)少內(nèi)容等)而被搜索引擎抓取程序直接跳過(guò)。搜索引擎爬行程序以數(shù)據(jù)表中已存在或新提交的鏈接順藤摸瓜式地進(jìn)行爬行以不斷發(fā)現(xiàn)新的URL,抓取程序在分析并確定該URL的頁(yè)面內(nèi)容有價(jià)值后,便將其整個(gè)頁(yè)面抓取下來(lái)放入到龐大的信息數(shù)據(jù)表中。新抓取的內(nèi)容在進(jìn)入信息數(shù)據(jù)表時(shí),并不是一股腦地堆積在那,而是按照信息數(shù)據(jù)庫(kù)中表的字段(如:網(wǎng)頁(yè)URL、title、描述、正文內(nèi)容、抓取時(shí)間、導(dǎo)出鏈接等)分門別類地將信息存儲(chǔ)起來(lái),以便滿足后期的數(shù)據(jù)索引操作。

