lib/metrics.py

import os
import time
import logging
import json
from asyncio import sleep
from dataclasses import dataclass, asdict, field
from functools import cache

import requests

from lib.data_types import AutoScalaerData, SystemMetrics, ModelMetrics
from typing import Awaitable, NoReturn, List

METRICS_UPDATE_INTERVAL = 1

log = logging.getLogger(__file__)


@cache
def get_url() -> str:
    use_ssl = os.environ.get("USE_SSL", "false") == "true"
    worker_port = os.environ[f"VAST_TCP_PORT_{os.environ['WORKER_PORT']}"]
    public_ip = os.environ["PUBLIC_IPADDR"]
    return f"http{'s' if use_ssl else ''}://{public_ip}:{worker_port}"


@dataclass
class Metrics:
    last_metric_update: float = 0.0
    update_pending: bool = False
    id: int = field(default_factory=lambda: int(os.environ["CONTAINER_ID"]))
    report_addr: List[str] = field(
        default_factory=lambda: os.environ["REPORT_ADDR"].split(",")
    )
    url: str = field(default_factory=get_url)
    system_metrics: SystemMetrics = field(default_factory=SystemMetrics.empty)
    model_metrics: ModelMetrics = field(default_factory=ModelMetrics.empty)

    def _request_start(self, workload: float, reqnum: int) -> None:
        """
        this function is called prior to forwarding a request to a model API.
        """
        log.debug("request start")
        self.model_metrics.workload_pending += workload
        self.model_metrics.workload_received += workload
        self.model_metrics.requests_recieved.add(reqnum)
        self.model_metrics.requests_working.add(reqnum)
        self.update_pending = True

    def _request_end(self, workload: float, reqnum: int) -> None:
        """
        this function is called after handling of a request ends, regardless of the outcome
        """
        self.model_metrics.workload_pending -= workload
        self.model_metrics.requests_working.discard(reqnum)

    def _request_success(self, workload: float) -> None:
        """
        this function is called after a response from model API is received and forwarded.
        """
        self.model_metrics.workload_served += workload
        self.update_pending = True

    def _request_errored(self, workload: float) -> None:
        """
        this function is called if model API returns an error
        """
        self.model_metrics.workload_errored += workload

    def _request_canceled(self, workload: float) -> None:
        """
        this function is called if client drops connection before model API has responded
        """
        self.model_metrics.workload_cancelled += workload

    async def _send_metrics_loop(self) -> Awaitable[NoReturn]:
        while True:
            await sleep(METRICS_UPDATE_INTERVAL)
            elapsed = time.time() - self.last_metric_update
            if self.system_metrics.model_is_loaded is False and elapsed >= 10:
                log.debug(f"sending loading model metrics after {int(elapsed)}s wait")
                self.__send_metrics_and_reset()
            elif self.update_pending or elapsed > 10:
                log.debug(f"sending loaded model metrics after {int(elapsed)}s wait")
                self.__send_metrics_and_reset()

    def _model_loaded(self, max_throughput: float) -> None:
        self.system_metrics.model_loading_time = (
            time.time() - self.system_metrics.model_loading_start
        )
        self.system_metrics.model_is_loaded = True
        self.model_metrics.max_throughput = max_throughput

    def _model_errored(self, error_msg: str) -> None:
        self.model_metrics.set_errored(error_msg)
        self.system_metrics.model_is_loaded = True

    #######################################Private#######################################

    def __send_metrics_and_reset(self):

        def compute_autoscaler_data() -> AutoScalaerData:
            return AutoScalaerData(
                id=self.id,
                loadtime=(self.system_metrics.model_loading_time or 0.0),
                cur_load=(self.model_metrics.workload_processing),
                max_perf=self.model_metrics.max_throughput,
                cur_perf=self.model_metrics.cur_perf,
                error_msg=self.model_metrics.error_msg or "",
                num_requests_working=len(self.model_metrics.requests_working),
                num_requests_recieved=len(self.model_metrics.requests_recieved),
                additional_disk_usage=self.system_metrics.additional_disk_usage,
                cur_capacity=0,
                max_capacity=0,
                url=self.url,
            )

        def send_data(report_addr: str) -> bool:
            data = compute_autoscaler_data()
            full_path = report_addr.rstrip("/") + "/worker_status/"
            log.debug(
                "\n".join(
                    [
                        "#" * 60,
                        f"sending data to autoscaler",
                        f"{json.dumps((asdict(data)), indent=2)}",
                        "#" * 60,
                    ]
                )
            )
            for attempt in range(1, 4):
                try:
                    res = requests.post(full_path, json=asdict(data), timeout=1)
                    res.raise_for_status()
                    return True
                except requests.Timeout:
                    log.debug(f"autoscaler status update timed out")
                except Exception as e:
                    log.debug(f"autoscaler status update failed with error: {e}")
                time.sleep(2)
                log.debug(f"retrying autoscaler status update, attempt: {attempt}")
            log.debug(f"failed to send update through {report_addr}")
            return False

        ###########

        self.system_metrics.update_disk_usage()

        for report_addr in self.report_addr:
            success = send_data(report_addr)
            if success is True:
                break
        self.update_pending = False
        self.model_metrics.reset()
        self.system_metrics.reset()
        self.last_metric_update = time.time()
initial commit 2024-09-04 11:19:30 -07:00			`import os`
			`import time`
			`import logging`
			`import json`
			`from asyncio import sleep`
			`from dataclasses import dataclass, asdict, field`
			`from functools import cache`

			`import requests`

			`from lib.data_types import AutoScalaerData, SystemMetrics, ModelMetrics`
Merge pull request #1 from Nader-gator/main 2024-09-04 11:53:45 -07:00			`from typing import Awaitable, NoReturn, List`
initial commit 2024-09-04 11:19:30 -07:00
			`METRICS_UPDATE_INTERVAL = 1`

			`log = logging.getLogger(__file__)`


			`@cache`
			`def get_url() -> str:`
			`use_ssl = os.environ.get("USE_SSL", "false") == "true"`
			`worker_port = os.environ[f"VAST_TCP_PORT_{os.environ['WORKER_PORT']}"]`
			`public_ip = os.environ["PUBLIC_IPADDR"]`
			`return f"http{'s' if use_ssl else ''}://{public_ip}:{worker_port}"`


			`@dataclass`
			`class Metrics:`
			`last_metric_update: float = 0.0`
			`update_pending: bool = False`
			`id: int = field(default_factory=lambda: int(os.environ["CONTAINER_ID"]))`
Merge pull request #1 from Nader-gator/main 2024-09-04 11:53:45 -07:00			`report_addr: List[str] = field(`
			`default_factory=lambda: os.environ["REPORT_ADDR"].split(",")`
			`)`
initial commit 2024-09-04 11:19:30 -07:00			`url: str = field(default_factory=get_url)`
			`system_metrics: SystemMetrics = field(default_factory=SystemMetrics.empty)`
			`model_metrics: ModelMetrics = field(default_factory=ModelMetrics.empty)`

			`def _request_start(self, workload: float, reqnum: int) -> None:`
			`"""`
			`this function is called prior to forwarding a request to a model API.`
			`"""`
			`log.debug("request start")`
			`self.model_metrics.workload_pending += workload`
			`self.model_metrics.workload_received += workload`
			`self.model_metrics.requests_recieved.add(reqnum)`
			`self.model_metrics.requests_working.add(reqnum)`
Send metrics on request start 2025-10-09 10:13:50 -07:00			`self.update_pending = True`
initial commit 2024-09-04 11:19:30 -07:00
redo metrics tracking for requests, fixes bug wherere some requests were marked as pending, even though they had finished (#24 ) 2025-08-08 17:01:21 -07:00			`def _request_end(self, workload: float, reqnum: int) -> None:`
initial commit 2024-09-04 11:19:30 -07:00			`"""`
redo metrics tracking for requests, fixes bug wherere some requests were marked as pending, even though they had finished (#24 ) 2025-08-08 17:01:21 -07:00			`this function is called after handling of a request ends, regardless of the outcome`
initial commit 2024-09-04 11:19:30 -07:00			`"""`
			`self.model_metrics.workload_pending -= workload`
			`self.model_metrics.requests_working.discard(reqnum)`
redo metrics tracking for requests, fixes bug wherere some requests were marked as pending, even though they had finished (#24 ) 2025-08-08 17:01:21 -07:00
			`def _request_success(self, workload: float) -> None:`
			`"""`
			`this function is called after a response from model API is received and forwarded.`
			`"""`
			`self.model_metrics.workload_served += workload`
initial commit 2024-09-04 11:19:30 -07:00			`self.update_pending = True`

redo metrics tracking for requests, fixes bug wherere some requests were marked as pending, even though they had finished (#24 ) 2025-08-08 17:01:21 -07:00			`def _request_errored(self, workload: float) -> None:`
initial commit 2024-09-04 11:19:30 -07:00			`"""`
			`this function is called if model API returns an error`
			`"""`
			`self.model_metrics.workload_errored += workload`

redo metrics tracking for requests, fixes bug wherere some requests were marked as pending, even though they had finished (#24 ) 2025-08-08 17:01:21 -07:00			`def _request_canceled(self, workload: float) -> None:`
initial commit 2024-09-04 11:19:30 -07:00			`"""`
			`this function is called if client drops connection before model API has responded`
			`"""`
			`self.model_metrics.workload_cancelled += workload`

			`async def _send_metrics_loop(self) -> Awaitable[NoReturn]:`
			`while True:`
			`await sleep(METRICS_UPDATE_INTERVAL)`
			`elapsed = time.time() - self.last_metric_update`
			`if self.system_metrics.model_is_loaded is False and elapsed >= 10:`
			`log.debug(f"sending loading model metrics after {int(elapsed)}s wait")`
Removed division by elapsed time, since autoscaler cur_load in units of workload 2025-10-08 16:54:18 -07:00			`self.__send_metrics_and_reset()`
initial commit 2024-09-04 11:19:30 -07:00			`elif self.update_pending or elapsed > 10:`
			`log.debug(f"sending loaded model metrics after {int(elapsed)}s wait")`
Removed division by elapsed time, since autoscaler cur_load in units of workload 2025-10-08 16:54:18 -07:00			`self.__send_metrics_and_reset()`
initial commit 2024-09-04 11:19:30 -07:00
			`def _model_loaded(self, max_throughput: float) -> None:`
			`self.system_metrics.model_loading_time = (`
			`time.time() - self.system_metrics.model_loading_start`
			`)`
			`self.system_metrics.model_is_loaded = True`
			`self.model_metrics.max_throughput = max_throughput`

			`def _model_errored(self, error_msg: str) -> None:`
			`self.model_metrics.set_errored(error_msg)`
			`self.system_metrics.model_is_loaded = True`

			`#######################################Private#######################################`

Removed division by elapsed time, since autoscaler cur_load in units of workload 2025-10-08 16:54:18 -07:00			`def __send_metrics_and_reset(self):`
initial commit 2024-09-04 11:19:30 -07:00
			`def compute_autoscaler_data() -> AutoScalaerData:`
			`return AutoScalaerData(`
			`id=self.id,`
			`loadtime=(self.system_metrics.model_loading_time or 0.0),`
Removed division by elapsed time, since autoscaler cur_load in units of workload 2025-10-08 16:54:18 -07:00			`cur_load=(self.model_metrics.workload_processing),`
initial commit 2024-09-04 11:19:30 -07:00			`max_perf=self.model_metrics.max_throughput,`
			`cur_perf=self.model_metrics.cur_perf,`
			`error_msg=self.model_metrics.error_msg or "",`
			`num_requests_working=len(self.model_metrics.requests_working),`
			`num_requests_recieved=len(self.model_metrics.requests_recieved),`
			`additional_disk_usage=self.system_metrics.additional_disk_usage,`
			`cur_capacity=0,`
			`max_capacity=0,`
			`url=self.url,`
			`)`

update report_addr to use new webserver endpoint with AS fallback 2025-08-12 13:31:19 -07:00			`def send_data(report_addr: str) -> bool:`
initial commit 2024-09-04 11:19:30 -07:00			`data = compute_autoscaler_data()`
stop using urljoin for worker_status endpoint 2025-06-17 23:09:45 -07:00			`full_path = report_addr.rstrip("/") + "/worker_status/"`
initial commit 2024-09-04 11:19:30 -07:00			`log.debug(`
			`"\n".join(`
			`[`
			`"#" * 60,`
			`f"sending data to autoscaler",`
			`f"{json.dumps((asdict(data)), indent=2)}",`
			`"#" * 60,`
			`]`
			`)`
			`)`
			`for attempt in range(1, 4):`
			`try:`
update report_addr to use new webserver endpoint with AS fallback 2025-08-12 13:31:19 -07:00			`res = requests.post(full_path, json=asdict(data), timeout=1)`
			`res.raise_for_status()`
			`return True`
initial commit 2024-09-04 11:19:30 -07:00			`except requests.Timeout:`
			`log.debug(f"autoscaler status update timed out")`
			`except Exception as e:`
			`log.debug(f"autoscaler status update failed with error: {e}")`
			`time.sleep(2)`
			`log.debug(f"retrying autoscaler status update, attempt: {attempt}")`
update report_addr to use new webserver endpoint with AS fallback 2025-08-12 13:31:19 -07:00			`log.debug(f"failed to send update through {report_addr}")`
			`return False`
initial commit 2024-09-04 11:19:30 -07:00
			`###########`

			`self.system_metrics.update_disk_usage()`
Merge pull request #1 from Nader-gator/main 2024-09-04 11:53:45 -07:00
			`for report_addr in self.report_addr:`
update report_addr to use new webserver endpoint with AS fallback 2025-08-12 13:31:19 -07:00			`success = send_data(report_addr)`
			`if success is True:`
			`break`
initial commit 2024-09-04 11:19:30 -07:00			`self.update_pending = False`
			`self.model_metrics.reset()`
			`self.system_metrics.reset()`
			`self.last_metric_update = time.time()`