源碼網(wǎng) 怎么獲取網(wǎng)頁源代碼中的文件?
怎么獲取網(wǎng)頁源代碼中的文件?網(wǎng)頁的源代碼是父網(wǎng)頁的代碼。網(wǎng)頁中有一種稱為iframe的節(jié)點(diǎn),相當(dāng)于網(wǎng)頁的子頁。其結(jié)構(gòu)與外部網(wǎng)頁完全一致??蚣茉创a是子網(wǎng)頁的源代碼。另外,網(wǎng)易云爬行推薦使用seleni
怎么獲取網(wǎng)頁源代碼中的文件?
網(wǎng)頁的源代碼是父網(wǎng)頁的代碼。網(wǎng)頁中有一種稱為iframe的節(jié)點(diǎn),相當(dāng)于網(wǎng)頁的子頁。其結(jié)構(gòu)與外部網(wǎng)頁完全一致。框架源代碼是子網(wǎng)頁的源代碼。另外,網(wǎng)易云爬行推薦使用selenium,因?yàn)槲覀冊(cè)谧鼍W(wǎng)易云爬行熱評(píng)操作時(shí),此時(shí)請(qǐng)求的代碼是父網(wǎng)頁的源代碼。此時(shí),我們無法請(qǐng)求子網(wǎng)頁的源代碼,也無法獲取需要提取的信息。這是因?yàn)樵跒閟elenium打開頁面之后,默認(rèn)操作是在父幀中,此時(shí),如果頁面位于中,則也存在子幀,而子幀無法獲取子幀中的節(jié)點(diǎn)。你需要使用開關(guān)到框架()切換幀的方法。此時(shí),請(qǐng)求的代碼從網(wǎng)頁源代碼切換到框架源代碼,然后我們可以提取所需的信息。