教程详情

1. 首先,安装所需的库:
bash
pip install requests beautifulsoup4
2. 然后,使用以下代码从网页中提取结构化数据:
python
import requests
from bs4 import BeautifulSoup
替换为你想要抓取的网页URL
url = 'https://example.com'
发送请求并获取响应
response = requests.get(url)
response.encoding = 'utf-8'
解析HTML内容
soup = BeautifulSoup(response.text, '.parser')
提取结构化数据
data = soup.find_all('div', class_='structured-data')
打印提取到的数据
for item in data:
print(item.text)
请将`https://example.com`替换为你想要抓取的网页URL。这段代码将提取网页中所有带有`class="structured-data"`的div标签中的文本内容。