Low-Latency Voice-Guided Visual Content Generation Using Generative AI Models: Delving into the realm of trade-offs of locally-hosted and cloud-based AI for real-time generative applications
Ala-Rantala, Juha (2025)
Ala-Rantala, Juha
2025
Tietotekniikan DI-ohjelma - Master's Programme in Information Technology
Informaatioteknologian ja viestinnän tiedekunta - Faculty of Information Technology and Communication Sciences
Hyväksymispäivämäärä
2025-09-30
Julkaisun pysyvä osoite on
https://urn.fi/URN:NBN:fi:tuni-202509309600
https://urn.fi/URN:NBN:fi:tuni-202509309600
Tiivistelmä
Generative artificial intelligence is increasingly applied to creative tasks such as visual content creation, yet its reliance on cloud systems can lead to long processing times and data privacy concerns. This thesis investigates these problems by demonstrating the practicality and performance of a multi-model system that runs on a local computer. It shows how to successfully design, build, and test a locally running system that combines automatic speech recognition, a language model for understanding commands and diffusion models for visual content generation. This system allows for low latency voice-guided image creation, editing, and video generation using high-end consumer hardware.
Following a constructive research approach, a working model of the system was developed and thoroughly tested. The local system worked much faster than typical cloud services. A conducted user study also showed an important point: while users liked the local system’s speed and data privacy, many preferred what they perceived as better quality results from cloud models for these creative tasks. This meant they were willing to wait longer for images they felt looked better.
This research provides strong practical evidence that running these models locally can work well for using voice-driven commands to do creative tasks in real time. It opens the way for more private systems with quick response times. The study also highlights the complex connection between how well a system performs technically and what users prefer in different situations, especially in the fast-changing field of generative artificial intelligence. Generatiivista tekoälyä hyödynnetään yhä laajemmin eri prosesseissa, myös luovissa, kuten visuaalisen sisällön tuottamisessa. Pilvipalveluihin perustuvat ratkaisut voivat kuitenkin aiheuttaa merkittäviä haasteita liittyen erityisesti viiveisiin ja tietosuojaan. Tässä diplomityössä tarkastellaan näitä haasteita ja osoitetaan, että paikallisesti suoritettava, useasta tekoälymallista koostuva järjestelmä on sekä käytännöllinen että suorituskykyinen vaihtoehto.
Tutkimuksessa suunniteltiin, toteutettiin ja testattiin konstruktiivisen tutkimuksen mukaisesti järjestelmä, joka yhdistää automaattisen puheentunnistuksen, käyttäjän komentojen tulkinnan kielimallilla sekä diffuusiomallit visuaalisen sisällön luontiin ja muokkaukseen. Järjestelmä mahdollistaa reaaliaikaisen ja puheohjatun kuvien ja videoiden tuottamisen tehokkaalla kuluttajatason laitteistolla.
Työn tuloksena syntynyt paikallinen järjestelmä oli huomattavasti nopeampi kuin vertailukohtana käytetyt pilvipalvelut. Käyttäjätutkimus paljasti kuitenkin keskeisen havainnon: vaikka käyttäjät arvostivat paikallisen järjestelmän nopeutta ja sille olennaista tietosuojaa, he olivat valmiita hyväksymään pidemmät odotusajat saadakseen pilvimallien tuottamia, korkealaatuisempina pidettyjä kuvia. Tämä korostaa, että luovissa tehtävissä lopputuloksen laatu koetaan usein pelkkää puhdasta teknistä suorituskykyä tärkeämmäksi. Työn perusteella paras ratkaisu löytyy hybridimallista, jossa nopea ideointi ja iterointi tehdään paikallisesti, ja viimeistely pilvessä silloin kun korkea laatu on ensisijaista.
Tämä tutkimus tarjoaa vahvaa näyttöä siitä, että generatiivisten tekoälymallien paikallinen suorittaminen on toimiva ratkaisu reaaliaikaisiin, puheohjattuihin luoviin sovelluksiin ja avaa uusia mahdollisuuksia nopeille ja tietoturvallisille järjestelmille. Samalla työ tuo esiin teknisen suorituskyvyn ja käyttäjäkokemuksen välisen moniulotteisen suhteen generatiivisen tekoälyn nopeasti kehittyvässä kentässä.
Following a constructive research approach, a working model of the system was developed and thoroughly tested. The local system worked much faster than typical cloud services. A conducted user study also showed an important point: while users liked the local system’s speed and data privacy, many preferred what they perceived as better quality results from cloud models for these creative tasks. This meant they were willing to wait longer for images they felt looked better.
This research provides strong practical evidence that running these models locally can work well for using voice-driven commands to do creative tasks in real time. It opens the way for more private systems with quick response times. The study also highlights the complex connection between how well a system performs technically and what users prefer in different situations, especially in the fast-changing field of generative artificial intelligence.
Tutkimuksessa suunniteltiin, toteutettiin ja testattiin konstruktiivisen tutkimuksen mukaisesti järjestelmä, joka yhdistää automaattisen puheentunnistuksen, käyttäjän komentojen tulkinnan kielimallilla sekä diffuusiomallit visuaalisen sisällön luontiin ja muokkaukseen. Järjestelmä mahdollistaa reaaliaikaisen ja puheohjatun kuvien ja videoiden tuottamisen tehokkaalla kuluttajatason laitteistolla.
Työn tuloksena syntynyt paikallinen järjestelmä oli huomattavasti nopeampi kuin vertailukohtana käytetyt pilvipalvelut. Käyttäjätutkimus paljasti kuitenkin keskeisen havainnon: vaikka käyttäjät arvostivat paikallisen järjestelmän nopeutta ja sille olennaista tietosuojaa, he olivat valmiita hyväksymään pidemmät odotusajat saadakseen pilvimallien tuottamia, korkealaatuisempina pidettyjä kuvia. Tämä korostaa, että luovissa tehtävissä lopputuloksen laatu koetaan usein pelkkää puhdasta teknistä suorituskykyä tärkeämmäksi. Työn perusteella paras ratkaisu löytyy hybridimallista, jossa nopea ideointi ja iterointi tehdään paikallisesti, ja viimeistely pilvessä silloin kun korkea laatu on ensisijaista.
Tämä tutkimus tarjoaa vahvaa näyttöä siitä, että generatiivisten tekoälymallien paikallinen suorittaminen on toimiva ratkaisu reaaliaikaisiin, puheohjattuihin luoviin sovelluksiin ja avaa uusia mahdollisuuksia nopeille ja tietoturvallisille järjestelmille. Samalla työ tuo esiin teknisen suorituskyvyn ja käyttäjäkokemuksen välisen moniulotteisen suhteen generatiivisen tekoälyn nopeasti kehittyvässä kentässä.
