Skip to main content
FHEDEEN
Infomaterial anfordern

Bachelor Flyer Master Flyer

Kontakt

Sekretariat Angewandte Informatik
Tel.: 0361 / 6700-5510 sekretariat-ai@fh-erfurt.de

Besucheranschrift:

Fachhochschule Erfurt
Fakultät Gebäudetechnik und Informatik
Fachrichtung Angewandte Informatik
Altonaer Straße 25
99085 Erfurt

Integration eines GPT-basierten Chatbots zur Analyse von Nachhaltigkeitsberichten

In der vorliegenden Bachelorarbeit wird ein System des Typs Retrieval-Augmented Generation (RAG) konzipiert und prototypisch umgesetzt, das fachbezogene Fragen am Beispiel des Deutschen Nachhaltigkeitskodex (DNK) beantworten kann. Die Motivation hierfür liegt in den Grenzen aktueller großer Sprachmodelle (Large Language Models, LLMs): Trotz beeindruckender genereller Sprachkompetenz stoßen sie bei spezifischen oder aktuellen Fachanfragen häufig an Wissensgrenzen und neigen zum Halluzinieren. Die RAG-Methodik koppelt ein LLM mit einer domänenspezifischen Dokumentensammlung, um Antworten mit aktuellen und fundierten Informationen zu ermöglichen.

Zur Umsetzung des Prototyps wurde ein End-to-End-System in Python entwickelt, das eine Ingestion-Pipeline, inhaltsbasierte Suche und generative Antworterstellung umfasst. Eine Ingestion-Pipeline mit URL-Crawler sammelt relevante DNK-Dokumente (Berichte 2024) und bereitet die Textdaten auf. Die Texte werden in Segmente zerlegt, als Vektor-Repräsentationen (Embeddings) abgebildet und in einer Vektordatenbank (ChromaDB) indexiert. Bei einer Nutzeranfrage ermittelt eine auf einem Ähnlichkeitsmaß basierende Suche über Embeddings in ChromaDB die relevantesten Segmente, die zusammen mit der Frage an ein Sprachmodell (LLM) übergeben werden. Das LLM generiert daraufhin mit Hilfe der zusätzlich bereitgestellten Informationen eine passende Antwort. Die Orchestrierung aller Schritte erfolgt mit dem LangChain-Framework und als Benutzerschnittstelle dient eine Streamlit-Webanwendung.

Das Ergebnis des Projekts ist ein funktionsfähiger Prototyp, der in der Lage ist, Fragen zu DNK-Inhalten zuverlässig zu beantworten. Die prototypische Anwendung demonstriert, dass RAG-Ansätze geeignet sind, um LLMs mit aktuellem Fachwissen anzureichern und die Antwortqualität in spezialisierten Domänen zu steigern. Die Systemfunktionalität wurde anhand von Beispielanfragen qualitativ evaluiert und erfüllte die gestellten Anforderungen. Auf die Erhebung quantitativer Leistungsmetriken wurde in dieser Arbeit verzichtet.

In this bachelor's thesis, a Retrieval-Augmented Generation (RAG) system is designed and prototypically implemented to answer domain-specific queries, with the German Sustainability Code (DNK) serving as the example domain. This approach is motivated by the limitations of current Large Language Models (LLMs). Despite their impressive general language capabilities, LLMs often reach their knowledge limits when confronted with specialized or up-to-date queries and tend to hallucinate. The RAG methodology couples an LLM with a domain-specific document collection to enable answers backed by up-to-date and reliable information.

For the prototype implementation, an end-to-end system was developed in Python that encompasses an ingestion pipeline, information based search, and answer generation. An ingestion pipeline with a URL crawler gathers relevant DNK documents (2024 reports) and preprocesses the text data. The texts are segmented into chunks, converted into vector representations (embeddings), and indexed in a vector database (ChromaDB). For a given user query, the system performs a similarity-based search on embeddings in ChromaDB to retrieve the most relevant segments. These segments are sent to an LLM along with the query, enabling it to generate a more suitable answer using the additional information provided. The orchestration of all steps is handled by the LangChain framework, and a Streamlit web application serves as the user interface.

The result of the project is a functional prototype capable of reliably answering questions about DNK content. The prototype demonstrates that RAG approaches are suitable for enriching LLMs with up-to-date domain knowledge and thereby improving the quality of answers in specialized domains. The system's functionality was evaluated qualitatively using example queries, and it met the specified requirements. No quantitative performance evaluation was conducted in this work.

Zurück