dcap = dict(DesiredCapabilities.PHANTOMJS) dcap["phantomjs.page.settings.userAgent"] = \ ("Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/53 (KHTML, like Gecko) Chrome/15.0.87") wd = webdriver.PhantomJS(desired_capabilities=dcap, service_args=['--ssl-protocol=tlsv1']) wd.set_window_size(1120, 550) wd.get("https://www.facebook.com/")
Python Selenium PhantomJS робота з Facebook
По замовчуванні PhantomJS на відріз відмовився працювати з Facebook, хоча webdriver.Firefox() працює прекрасно. Методом гугління, проб і помилок вияснилось, що проблема при роботі з SSL. Отже, робочий "сніпєтс":
Прочитати змінений скриптами DOM в Selenium
Простенькі сайти можна парсити через curl+lxml чи щось інше. Динамічні сайти, які генеруються за допомогою скриптів на стороні клієнта можна парсити через Selenium і отримувати код сторінки через driver.page_source. Але є ще більш комплексні сайти (наприклад Facebook), які після завантаження і генерації сторінки додатково змінюють DOM і page_source вже не допоможе. Для вирішення питання треба запустити скрипт:
outerhtml = wd.execute_script("return document.documentElement.outerHTML")
tree = etree.parse(StringIO(outerhtml), parser)
Пакетне переіменування розширення файлів в bash
ls *.mp4* | xargs -I {} sh -c 'mv ${1} ${1%.*}.mp4' - {}
Скрапер weblancer.net на python+lxml
Колега попросив помогти знайти помилку в скрипті. Парсалось за допомогою BS, а я його ненавиджу. Переписав на lxml
#!/usr/bin/env python
#-*- coding: utf-8 -*-
import re from lxml import etree from lxml import html as lxml_html import urllib2 from io import StringIO _base_url = "https://www.weblancer.net/projects/?page={}" def main(): parser = lxml_html.HTMLParser(encoding='windows-1251') page =urllib2.urlopen(_base_url.format(1)) data=page.read() tree = etree.parse(StringIO(data.decode("windows-1251", errors="ignore")), parser) last_page_url = tree.xpath("//ul[@class='pagination']/li[last()]/a/@href")[0] last_page = re.compile(r"(\d+)").search(last_page_url).group(1) for i in range(0, int(last_page)+1): page =urllib2.urlopen(_base_url.format(i)) data=page.read() tree = etree.parse(StringIO(data.decode("windows-1251", errors="ignore")), parser) search_results = tree.xpath("//div[@class='container-fluid cols_table show_visited']/div[@class='row']") for sr in search_results: title = sr.xpath("./div[@class='col-sm-7']/a[@class='title']/text()")[0].lstrip().rstrip() categories = sr.xpath("./div[@class='col-sm-7']/div[@class='text-muted']/a[@class='text-muted']/text()")[0].lstrip().rstrip() try: price = sr.xpath("./div[@class='col-sm-2 amount title']/text()")[0].lstrip().rstrip() except IndexError: price = ''
try: application = sr.xpath("./div[@class='col-sm-3 text-right text-nowrap hidden-xs']/text()")[0].lstrip().rstrip() except IndexError: application = '' print title, categories, application, price if __name__ == "__main__": main()
Прибирання дубляжів об'єктів моделі, які знаходяться у списку (Django, Python)
objects = [obj1, obj2, obj3,]
uniq = [] seen = set() for obj in objects: if obj.pk not in seen: uniq.append(obj) seen.add(obj.pk)
xfce і ширина скролбару
По замовчуванні ширина скролбару дуже маленька, пікселів може з 5, що не дуже зручно.
Лікується наступним чином:
Створюємо або редагуємо файл "~/.gtkrc-2.0"
Вписуємо:
Лікується наступним чином:
Створюємо або редагуємо файл "~/.gtkrc-2.0"
Вписуємо:
style "myscrollbar"
{
GtkScrollbar::slider-width=20
}
class "GtkScrollbar" style "myscrollbar"
Як повернути іконку network manager у панельку xfce
Йдемо у /etc/xdg/autostart/nm-applet.desktop:
# sudo su
# nano /etc/xdg/autostart/nm-applet.desktop
Шукаємо лінію з Exec.
Міняємо запис:
nm-applet
на
dbus-launch nm-applet
# sudo su
# nano /etc/xdg/autostart/nm-applet.desktop
Шукаємо лінію з Exec.
Міняємо запис:
nm-applet
на
dbus-launch nm-applet
Підписатися на:
Дописи (Atom)