/
eb
/
python_learn
Обзор
Документация
Войти
/
eb
/
python_learn
Код
Запросы
0
Пакеты
0
Релизы
0
CI/CD
Аналитика
Безопасность
main
web_scraping/beautiful_soup_intro.py
37 строк
1 KB
EvgeniyBudaev
Извлечение данных иерархически
25 фев 2021, 08:09
25 фев 2021, 08:09
9a3aafe
Код
Авторство
О чём код?
from bs4 import BeautifulSoup # парсить html код html_string = """ <!DOCTYPE html> <html lang="en"> <head> <meta charset="UTF-8"> <meta name="viewport" content="width=device-width, initial-scale=1.0"> <title>Web Scraping</title> </head> <body> <h1>Hello, World!</h1> <h3>Programming Languages</h3> <p>Lorem ipsum dolor sit amet consectetur adipisicing elit. Nobis, doloremque.</p> <ol> <li class="list__item">HTML</li> <li id="css-li">CSS</li> <li class="list__item">JavaScript</li> <li class="list__item">Python</li> </ol> </body> </html> """ parsed_html = BeautifulSoup(html_string, 'html.parser') print(parsed_html) print(type(parsed_html)) print(parsed_html.body.h1) print(parsed_html.find('li')) print('all li: ', parsed_html.find_all('li')) print(parsed_html.find(id="css-li")) # поиск по id print('select по id: ', parsed_html.select("#css-li")) # список print(parsed_html.find(class_="list__item")) # поиск по классу print('select по class: ', parsed_html.select(".list__item")) # список print('select по class: ', parsed_html.select(".list__item")[0])