CLEVER: Kollaboratives Edge-Cloud-Kontinuum und eingebettete KI für eine visionäre Industrie der Zukunft

ein Projekt zur Ermöglichung eines kollaborativen Edge-Cloud-Kontinuums und eingebetteter KI, gefördert durch der EU und das BMFTR : Abschlussbericht der Leibniz Universität Hannover (LUH)

Loading...
Thumbnail Image

Editor

Advisor

Volume

Issue

Journal

Series Titel

Book Title

Publisher

Hannover : Technische Informationsbibliothek

Supplementary Material

Other Versions

Link to publishers' Version

Abstract

Dieser Bericht fasst die wichtigsten Ergebnisse, weiterführenden Resultate, gewonnenen Erkenntnisse sowie die Verwertungsperspektiven des Beitrags der LUH zum Projekt CLEVER zusammen. Die Arbeiten der LUH konzentrierten sich auf intelligente Middleware-Komponenten für das Cloud-Edge-Kontinuum, wobei der Schwerpunkt auf KI-gestützter Graphgenerierung, Orchestrierung und automatisierter Wartung lag. Der zentrale technische Beitrag ist ein energiebewusster Scheduling-Ansatz, der den Scheduling-Prozess von Kubernetes um eine auf maschinellem Lernen basierende Bewertung (Scoring) erweitert. Ziel war es, fundiertere Entscheidungen zur Platzierung von Workloads über lokale Cluster und verteilte Cloud-Edge-Infrastrukturen hinweg zu ermöglichen und dabei die Kompatibilität mit etablierten Cloud-nativen Betriebspraktiken zu wahren. Die Arbeiten adressierten eine praktische Herausforderung, die für moderne digitale Infrastrukturen zunehmend an Bedeutung gewinnt: Wenn eine Anwendungs-Workload an einen Cluster übermittelt wird, muss die Plattform entscheiden, wo diese ausgeführt werden soll. Standard-Orchestrierungsmechanismen können zwar sicherstellen, dass Workloads auf geeigneten Knoten platziert werden, berücksichtigen jedoch nicht zwangsläufig das Energieverhalten verschiedener Worker-Knoten oder die sich im Zeitverlauf ändernden Ressourcenanforderungen der Workloads. Daher entwickelte die LUH eine Scheduler-Komponente, die Telemetriedaten, graphbasiertes Systemwissen und maschinelles Lernen nutzt, um Platzierungsvorschläge zu generieren. Diese berücksichtigen Anforderungen an CPU, Arbeitsspeicher, Netzwerk, Speicher und GPU sowie die aktuelle Knotenauslastung und energiebezogene Eigenschaften. Der implementierte Prototyp integriert sich über die Phasen „preScore“ und „Score“ der Scheduling-Pipeline in Kubernetes. Er ist als per Helm bereitstellbare Entscheidungsinstanz (Decision Engine) konzipiert und umfasst einen benutzerdefinierten Scheduler, einen Cache sowie ein trainiertes Modell, das über eine REST-API angesprochen wird. Die API empfängt Informationen zu Workloads und Knoten im JSON-Format, validiert und normalisiert die Eingaben und liefert Bewertungen für geeignete Knoten zurück. Der höchste Bewertungswert kennzeichnet jenen Knoten, von dem das optimale Gleichgewicht zwischen Ressourcenbeschränkungen, Leistungsanforderungen und Energieeffizienz erwartet wird. Auf diese Weise kann der Scheduler die Platzierung von Workloads beeinflussen, ohne Kubernetes als zugrundeliegende Orchestrierungsplattform zu ersetzen. Im Projektverlauf wurden verschiedene Methoden des maschinellen Lernens untersucht, darunter Graph Neural Networks, Deep Q-Learning und Proximal Policy Optimization. Das implementierte Modell nutzt ein Deep Q-Network, das darauf trainiert wurde, eingehende Workloads geeigneten Rechenknoten zuzuordnen. Der Beobachtungsraum kombiniert Workload-Anforderungen, Knotenauslastung, energiebezogene Knoteneigenschaften, CPU-Kapazität sowie ein Workload-spezifisches Ranking der Energieeffizienz. Um die begrenzte Verfügbarkeit und Qualität realer Produktionsdaten (Traces) zu kompensieren, entwickelte die LUH zudem einen Generator für synthetische Workloads sowie eine Kubernetes-ähnliche Simulationsumgebung. Diese Werkzeuge erzeugen vielfältige Workload-Profile – etwa für E-Commerce, Batch-Verarbeitung und Datenanalyse – und ermöglichen reproduzierbare Trainings- und Evaluierungsprozesse unter kontrollierten Bedingungen. Das Evaluierungs-Framework vergleicht den eigens entwickelten Scheduler mit dem Standard-Kubernetes-Scheduler, indem es die Zuweisung von Pods zu Knoten, den Energieverbrauch, die Job-Abschlusszeiten sowie die Effizienz der Aufgabenplanung erfasst. Die Versuchsergebnisse zeigen, dass der KI-basierte Scheduler den Energieverbrauch in ausgewählten Szenarien um etwa 4 bis 8 % senken kann, ohne dabei die korrekte Platzierung der Workloads zu beeinträchtigen. Über die quantitativen Einsparungen hinaus lieferte das Projekt praktische Erkenntnisse in den Bereichen telemetrie-gestützte Orchestrierung, zeitbasierte Graphendarstellungen des Cluster-Zustands, REST-basierte Modellintegration, Cache-basierte Resilienz sowie die operative Einbindung von KI-Komponenten in Middleware-Systeme. Die Ergebnisse schaffen einen Mehrwert, der über den eigentlichen Prototyp hinausgeht. Wissenschaftlich stärken sie die Forschung der LUH zu nachhaltigem Cloud-Edge-Computing, intelligenter Orchestrierung und adaptivem Ressourcenmanagement. Technisch gesehen lassen sich die entwickelten Komponenten in künftigen Testumgebungen, Forschungsprojekten und Demonstratoren wiederverwenden und erweitern. Aus Anwendungssicht ist der Ansatz für Rechenzentren, Edge-Cloud-Plattformen, industrielle Systeme, öffentliche Dienste sowie Analyseumgebungen relevant, die verteilte Workloads effizient betreiben müssen. Das Verwertungspotenzial liegt somit in der weiteren Forschung, der Lehre, der Projektakquise, im Benchmarking sowie im Transfer hin zu einer energieeffizienteren digitalen Infrastruktur.


This report summarizes the main results, additional outcomes, lessons learned, and exploitation perspectives of the LUH contribution to the CLEVER project. LUH’s work focused on intelligent middleware components for the cloud-edge continuum, with particular emphasis on AI-supported graph generation, orchestration, and automated maintenance. The central technical contribution is an energy-aware scheduling approach that extends the Kubernetes scheduling process with machine-learning-based scoring. The objective was to support better workload placement decisions across local clusters and distributed cloud-edge infrastructures, while keeping the solution compatible with established cloud-native operating practices. The work addressed a practical challenge that is increasingly important for modern digital infrastructures: when an application workload is submitted to a cluster, the platform must decide where it should run. Standard orchestration mechanisms can ensure that workloads are placed on feasible nodes, but they do not necessarily account for the energy behavior of different worker nodes or for the changing resource demands of workloads over time. LUH therefore developed a scheduler component that uses telemetry, graph-based system knowledge, and machine learning to recommend placements that consider CPU, memory, network, storage, and GPU requirements together with current node utilization and energy-related characteristics. The implemented prototype integrates with Kubernetes through the preScore and Score phases of the scheduling pipeline. It is packaged as a Helm-deployable decision engine containing a custom scheduler, a cache, and a trained model exposed through a REST API. The API receives workload and node information in JSON format, validates and normalizes the input, and returns scores for feasible nodes. The highest score represents the node expected to provide the best balance between resource constraints, performance needs, and energy efficiency. In this way, the scheduler can influence workload placement without replacing Kubernetes as the underlying orchestration platform. Several machine learning methods were explored during the project, including graph neural networks, Deep Q-Learning, and Proximal Policy Optimization. The implemented model uses a Deep Q-Network trained to map incoming workloads to suitable compute nodes. Its observation space combines workload demands, node utilization, node power characteristics, CPU capacity, and a workload-specific energy-efficiency ranking. To overcome the limited availability and quality of real production traces, LUH also developed a synthetic workload generator and a Kubernetes-like simulation environment. These tools create diverse workload profiles, such as e-commerce, batch processing, and data analytics workloads, and enable repeatable training and evaluation under controlled conditions. The evaluation framework compares the custom scheduler with the standard Kubernetes scheduler by recording pod-to-node assignments, energy consumption, job completion times, and scheduling effectiveness. Experimental results indicate that the AI-based scheduler can reduce energy consumption by approximately 4-8% in selected scenarios while maintaining valid workload placement. Beyond the quantitative savings, the project generated practical experience in telemetry-driven orchestration, temporal graph representations of cluster state, REST-based model integration, cache-based resilience, and the operational embedding of AI components in middleware systems. The results create value beyond the immediate prototype. Scientifically, they strengthen LUH’s research on sustainable cloud-edge computing, intelligent orchestration, and adaptive resource management. Technically, the developed components can be reused and extended in future testbeds, research projects, and demonstrations. From an application perspective, the approach is relevant for data centers, edge-cloud platforms, industrial systems, public services, and analytics environments that must operate distributed workloads efficiently. The exploitation potential therefore lies in further research, teaching, project acquisition, benchmarking activities, and transfer toward more energy-aware digital infrastructure.

Description

Keywords

Keywords GND

Conference

Publication Type

Report

Version

publishedVersion

License

Creative Commons Attribution-NonDerivs 3.0 Germany