/
telnov.ob
/
cerberus
Обзор
Документация
Войти
/
telnov.ob
/
cerberus
Код
Запросы
0
Задачи
Вики
Пакеты
0
Релизы
0
Аналитика
Безопасность
master
python-lxml/python-lxml.org
40 строк
2 KB
Daniel J Wilcox
notes
07 апр 2021, 18:00
07 апр 2021, 18:00
8220ef3
Код
Авторство
О чём код?
#+STARTUP: content * python lxml cat webpage into python *** all links that contain youtube #+begin_src sh python -c "from lxml.html import parse; from sys import stdin; print('\n'.join(parse(stdin).xpath('//a[(contains(., \'youtube.com\'))]/@href')))" #+end_src + 2 paths not working #+begin_src sh python -c "from lxml.html import parse; from sys import stdin; print(''.join(parse(stdin).xpath('//a[(contains(., \'youtube.com\'))]/@href and //a[(contains(., \'youtube.com\'))]/span[@class]/text()')))" #+end_src **** with sed and grep #+begin_src sh python -c "from lxml.html import parse; from sys import stdin; print('\n'.join(parse(stdin).xpath('//a[(contains(., \'youtube.com\'))]/@href')))" | grep -oP '(?=https://www.youtube.com)[^&]*(?=&)' | sed 's/%3Fv%3D/?v=/' #+end_src *** span tags child of a tag with href of youtube.com #+begin_src sh python -c "from lxml.html import parse; from sys import stdin; print('\n'.join(parse(stdin).xpath('//a[(contains(., \'youtube.com\'))]/span[@class]/text()')))" #+end_src **** span tags child of a tag with href of youtube.com with sed #+begin_src sh python -c "from lxml.html import parse; from sys import stdin; print('\n'.join(parse(stdin).xpath('//a[(contains(., \'youtube.com\'))]/span[@class]/text()')))" | sed '/^[[:space:]]*$/d' #+end_src *** span tags child of a tag with href of not youtube.com #+begin_src sh python -c "from lxml.html import parse; from sys import stdin; print('\n'.join(parse(stdin).xpath('//a[not(contains(., \'youtube.com\'))]/span[@class]/text()')))" | sed '/^[[:space:]]*$/d' #+end_src