Configurable "Browser Steps" when Playwright/Chrome is configured (enter text, scroll, wait for text, click button etc) (#478)

2022-11-24 20:53:01 +01:00
parent c98536ace4
commit 5b530ff61c
27 changed files with 1852 additions and 476 deletions
--- a/changedetectionio/content_fetcher.py
+++ b/changedetectionio/content_fetcher.py
@@ -1,7 +1,7 @@
 from abc import abstractmethod
-from pkg_resources import resource_string
 import chardet
 import json
+import logging
 import os
 import requests
 import sys
@@ -30,6 +30,12 @@ class JSActionExceptions(Exception):
        self.message = message
        return

+class BrowserStepsStepTimout(Exception):
+    def __init__(self, step_n):
+        self.step_n = step_n
+        return
+
+
 class PageUnloadable(Exception):
    def __init__(self, status_code, url, screenshot=False, message=False):
        # Set this so we can use it in other parts of the app
@@ -70,6 +76,8 @@ class Fetcher():
    status_code = None
    content = None
    headers = None
+    browser_steps = None
+    browser_steps_screenshot_path = None

    fetcher_description = "No description"
    webdriver_js_execute_code = None
@@ -86,8 +94,10 @@ class Fetcher():
    render_extract_delay = 0

    def __init__(self):
+        from pkg_resources import resource_string
        # The code that scrapes elements and makes a list of elements/size/position to click on in the VisualSelector
        self.xpath_element_js = resource_string(__name__, "res/xpath_element_scraper.js").decode('utf-8')
+        self.xpath_element_js = self.xpath_element_js.replace('%ELEMENTS%', 'div,span,form,table,tbody,tr,td,a,p,ul,li,h1,h2,h3,h4, header, footer, section, article, aside, details, main, nav, section')

    @abstractmethod
    def get_error(self):
@@ -113,11 +123,62 @@ class Fetcher():
    def get_last_status_code(self):
        return self.status_code

+    @abstractmethod
+    def screenshot_step(self, step_n):
+        return None
+
    @abstractmethod
    # Return true/false if this checker is ready to run, in the case it needs todo some special config check etc
    def is_ready(self):
        return True

+    def iterate_browser_steps(self):
+        from changedetectionio.blueprint.browser_steps.browser_steps import steppable_browser_interface
+        from playwright._impl._api_types import TimeoutError
+        from jinja2 import Environment
+        jinja2_env = Environment(extensions=['jinja2_time.TimeExtension'])
+
+        step_n = 0
+
+        if self.browser_steps is not None and len(self.browser_steps):
+            interface = steppable_browser_interface()
+            interface.page = self.page
+
+            valid_steps = filter(lambda s: (s['operation'] and len(s['operation']) and s['operation'] != 'Choose one' and s['operation'] != 'Goto site'), self.browser_steps)
+
+            for step in valid_steps:
+                step_n += 1
+                print(">> Iterating check - browser Step n {} - {}...".format(step_n, step['operation']))
+                self.screenshot_step("before-"+str(step_n))
+                self.save_step_html("before-"+str(step_n))
+                try:
+                    optional_value = step['optional_value']
+                    selector = step['selector']
+                    # Support for jinja2 template in step values, with date module added
+                    if '{%' in step['optional_value'] or '{{' in step['optional_value']:
+                        optional_value = str(jinja2_env.from_string(step['optional_value']).render())
+                    if '{%' in step['selector'] or '{{' in step['selector']:
+                        selector = str(jinja2_env.from_string(step['selector']).render())
+
+                    getattr(interface, "call_action")(action_name=step['operation'],
+                                                      selector=selector,
+                                                      optional_value=optional_value)
+                    self.screenshot_step(step_n)
+                    self.save_step_html(step_n)
+                except TimeoutError:
+                    # Stop processing here
+                    raise BrowserStepsStepTimout(step_n=step_n)
+
+
+
+    # It's always good to reset these
+    def delete_browser_steps_screenshots(self):
+        import glob
+        if self.browser_steps_screenshot_path is not None:
+            dest = os.path.join(self.browser_steps_screenshot_path, 'step_*.jpeg')
+            files = glob.glob(dest)
+            for f in files:
+                os.unlink(f)

 #   Maybe for the future, each fetcher provides its own diff output, could be used for text, image
 #   the current one would return javascript output (as we use JS to generate the diff)
@@ -136,7 +197,6 @@ def available_fetchers():

    return p

-
 class base_html_playwright(Fetcher):
    fetcher_description = "Playwright {}/Javascript".format(
        os.getenv("PLAYWRIGHT_BROWSER_TYPE", 'chromium').capitalize()
@@ -174,15 +234,26 @@ class base_html_playwright(Fetcher):

        # allow per-watch proxy selection override
        if proxy_override:
-            # https://playwright.dev/docs/network#http-proxy
-            from urllib.parse import urlparse
-            parsed = urlparse(proxy_override)
-            proxy_url = "{}://{}:{}".format(parsed.scheme, parsed.hostname, parsed.port)
-            self.proxy = {'server': proxy_url}
-            if parsed.username:
-                self.proxy['username'] = parsed.username
-            if parsed.password:
-                self.proxy['password'] = parsed.password
+            self.proxy = {'server': proxy_override}
+
+    def screenshot_step(self, step_n=''):
+
+        # There's a bug where we need to do it twice or it doesnt take the whole page, dont know why.
+        self.page.screenshot(type='jpeg', clip={'x': 1.0, 'y': 1.0, 'width': 1280, 'height': 1024})
+        screenshot = self.page.screenshot(type='jpeg', full_page=True, quality=85)
+
+        if self.browser_steps_screenshot_path is not None:
+            destination = os.path.join(self.browser_steps_screenshot_path, 'step_{}.jpeg'.format(step_n))
+            logging.debug("Saving step screenshot to {}".format(destination))
+            with open(destination, 'wb') as f:
+                f.write(screenshot)
+
+    def save_step_html(self, step_n):
+        content = self.page.content()
+        destination = os.path.join(self.browser_steps_screenshot_path, 'step_{}.html'.format(step_n))
+        logging.debug("Saving step HTML to {}".format(destination))
+        with open(destination, 'w') as f:
+            f.write(content)

    def run(self,
            url,
@@ -195,9 +266,9 @@ class base_html_playwright(Fetcher):

        from playwright.sync_api import sync_playwright
        import playwright._impl._api_types
-        from playwright._impl._api_types import Error, TimeoutError
-        response = None

+        self.delete_browser_steps_screenshots()
+        response = None
        with sync_playwright() as p:
            browser_type = getattr(p, self.browser_type)

@@ -217,89 +288,86 @@ class base_html_playwright(Fetcher):
                accept_downloads=False
            )

+            self.page = context.new_page()
            if len(request_headers):
                context.set_extra_http_headers(request_headers)

-            page = context.new_page()
            try:
-                page.set_default_navigation_timeout(90000)
-                page.set_default_timeout(90000)
+                self.page.set_default_navigation_timeout(90000)
+                self.page.set_default_timeout(90000)

                # Listen for all console events and handle errors
-                page.on("console", lambda msg: print(f"Playwright console: Watch URL: {url} {msg.type}: {msg.text} {msg.args}"))
+                self.page.on("console", lambda msg: print(f"Playwright console: Watch URL: {url} {msg.type}: {msg.text} {msg.args}"))

                # Bug - never set viewport size BEFORE page.goto

+
                # Waits for the next navigation. Using Python context manager
                # prevents a race condition between clicking and waiting for a navigation.
-                with page.expect_navigation():
-                    response = page.goto(url, wait_until='load')
+                with self.page.expect_navigation():
+                    response = self.page.goto(url, wait_until='load')
+                # Wait_until = commit
+                # - `'commit'` - consider operation to be finished when network response is received and the document started loading.
+                # Better to not use any smarts from Playwright and just wait an arbitrary number of seconds
+                # This seemed to solve nearly all 'TimeoutErrors'
+                extra_wait = int(os.getenv("WEBDRIVER_DELAY_BEFORE_CONTENT_READY", 5)) + self.render_extract_delay
+                self.page.wait_for_timeout(extra_wait * 1000)

+                if self.webdriver_js_execute_code is not None and len(self.webdriver_js_execute_code):
+                    self.page.evaluate(self.webdriver_js_execute_code)

            except playwright._impl._api_types.TimeoutError as e:
                context.close()
                browser.close()
                # This can be ok, we will try to grab what we could retrieve
                pass
-
            except Exception as e:
-                print("other exception when page.goto")
-                print(str(e))
+                print ("other exception when page.goto")
+                print (str(e))
                context.close()
                browser.close()
-                raise PageUnloadable(url=url, status_code=None, message=e.message)
+                raise PageUnloadable(url=url, status_code=None)
+

            if response is None:
                context.close()
                browser.close()
-                print("response object was none")
+                print ("response object was none")
                raise EmptyReply(url=url, status_code=None)

+            # Bug 2(?) Set the viewport size AFTER loading the page
+            self.page.set_viewport_size({"width": 1280, "height": 1024})
+
+            # Run Browser Steps here
+            self.iterate_browser_steps()

-            # Removed browser-set-size, seemed to be needed to make screenshots work reliably in older playwright versions
-            # Was causing exceptions like 'waiting for page but content is changing' etc
-            # https://www.browserstack.com/docs/automate/playwright/change-browser-window-size 1280x720 should be the default
-                        
            extra_wait = int(os.getenv("WEBDRIVER_DELAY_BEFORE_CONTENT_READY", 5)) + self.render_extract_delay
            time.sleep(extra_wait)

-            if self.webdriver_js_execute_code is not None:
-                try:
-                    page.evaluate(self.webdriver_js_execute_code)
-                except Exception as e:
-                    # Is it possible to get a screenshot?
-                    error_screenshot = False
-                    try:
-                        page.screenshot(type='jpeg',
-                                        clip={'x': 1.0, 'y': 1.0, 'width': 1280, 'height': 1024},
-                                        quality=1)

-                        # The actual screenshot
-                        error_screenshot = page.screenshot(type='jpeg',
-                                                           full_page=True,
-                                                           quality=int(os.getenv("PLAYWRIGHT_SCREENSHOT_QUALITY", 72)))
-                    except Exception as s:
-                        pass
-
-                    raise JSActionExceptions(status_code=response.status, screenshot=error_screenshot, message=str(e), url=url)
-
-                else:
-                    # JS eval was run, now we also wait some time if possible to let the page settle
-                    if self.render_extract_delay:
-                        page.wait_for_timeout(self.render_extract_delay * 1000)
-
-            page.wait_for_timeout(500)
-
-            self.content = page.content()
+            self.content = self.page.content()
            self.status_code = response.status
+
+            if len(self.page.content().strip()) == 0:
+                context.close()
+                browser.close()
+                print ("Content was empty")
+                raise EmptyReply(url=url, status_code=None)
+
+            # Bug 2(?) Set the viewport size AFTER loading the page
+            self.page.set_viewport_size({"width": 1280, "height": 1024})
+
+            self.status_code = response.status
+            self.content = self.page.content()
            self.headers = response.all_headers()

+            # So we can find an element on the page where its selector was entered manually (maybe not xPath etc)
            if current_include_filters is not None:
-                page.evaluate("var include_filters={}".format(json.dumps(current_include_filters)))
+                self.page.evaluate("var include_filters={}".format(json.dumps(current_include_filters)))
            else:
-                page.evaluate("var include_filters=''")
+                self.page.evaluate("var include_filters=''")

-            self.xpath_data = page.evaluate("async () => {" + self.xpath_element_js + "}")
+            self.xpath_data = self.page.evaluate("async () => {" + self.xpath_element_js.replace('%ELEMENTS%', 'div,span,form,table,tbody,tr,td,a,p,ul,li,h1,h2,h3,h4, header, footer, section, article, aside, details, main, nav, section, summary') + "}")

            # Bug 3 in Playwright screenshot handling
            # Some bug where it gives the wrong screenshot size, but making a request with the clip set first seems to solve it
@@ -310,26 +378,17 @@ class base_html_playwright(Fetcher):
            # acceptable screenshot quality here
            try:
                # Quality set to 1 because it's not used, just used as a work-around for a bug, no need to change this.
-                page.screenshot(type='jpeg', clip={'x': 1.0, 'y': 1.0, 'width': 1280, 'height': 1024}, quality=1)
+                self.page.screenshot(type='jpeg', clip={'x': 1.0, 'y': 1.0, 'width': 1280, 'height': 1024}, quality=1)
                # The actual screenshot
-                self.screenshot = page.screenshot(type='jpeg', full_page=True, quality=int(os.getenv("PLAYWRIGHT_SCREENSHOT_QUALITY", 72)))
+                self.screenshot = self.page.screenshot(type='jpeg', full_page=True, quality=int(os.getenv("PLAYWRIGHT_SCREENSHOT_QUALITY", 72)))
            except Exception as e:
                context.close()
                browser.close()
                raise ScreenshotUnavailable(url=url, status_code=None)

-            if len(self.content.strip()) == 0:
-                context.close()
-                browser.close()
-                print("Content was empty")
-                raise EmptyReply(url=url, status_code=None, screenshot=self.screenshot)
-
            context.close()
            browser.close()

-            if not ignore_status_codes and self.status_code!=200:
-                raise Non200ErrorCodeReceived(url=url, status_code=self.status_code, page_html=self.content, screenshot=self.screenshot)
-
 class base_html_webdriver(Fetcher):
    if os.getenv("WEBDRIVER_URL"):
        fetcher_description = "WebDriver Chrome/Javascript via '{}'".format(os.getenv("WEBDRIVER_URL"))
@@ -423,7 +482,6 @@ class base_html_webdriver(Fetcher):
    def is_ready(self):
        from selenium import webdriver
        from selenium.webdriver.common.desired_capabilities import DesiredCapabilities
-        from selenium.common.exceptions import WebDriverException

        self.driver = webdriver.Remote(
            command_executor=self.command_executor,