Beelden, Stem en Video — Hoe de Mediakant Werkt

Hoe het werkt

De chat en de plaatjes komen uit volledig gescheiden systemen die nauwelijks met elkaar praten. Dat ene feit verklaart waarom het gezicht van je companion steeds verandert en waarom media altijd als eerste wordt afgeknepen.

We kunnen een commissie ontvangen via de links op deze pagina. Dit beïnvloedt onze beoordelingen nooit.

Mensen gaan ervan uit dat een companion-app één intelligentie is die kan praten, tekenen en spreken. Het zijn drie of vier losse systemen die door de app aan elkaar zijn geknoopt, en de meeste frustraties aan deze kant komen uit de naden ertussen.

Drie motoren, één venster

Het taalmodel voert het gesprek. Het produceert tekst en verder niets.

Het beeldmodel is een compleet ander systeem. Het neemt een tekstbeschrijving en maakt daar een afbeelding van. Het heeft jullie gesprek nooit gezien.

Het spraaksysteem zet tekst om in audio. Ook apart, ook blind voor alles behalve de zin die het krijgt aangereikt.

Vraag je je companion om een foto, dan gebeurt dit: het taalmodel schrijft een korte beschrijving van de gevraagde afbeelding, de app plakt daar de opgeslagen uiterlijkkenmerken van het personage bij, die gecombineerde opdracht gaat naar het beeldmodel, en er komt een plaatje terug. De chat reageert vervolgens op een afbeelding die hij niet kan zien.

Die estafette is de bron van vrijwel elke klacht over media in deze categorie.

Waarom het gezicht steeds verandert

Omdat een beeldmodel jouw personage niet ophaalt, maar iemand genereert die bij een beschrijving past. "Lang donker haar, groene ogen, midden twintig" beschrijft miljoenen gezichten, en je krijgt er elke keer een ander.

Apps lossen dit in verschillende mate op: met opgeslagen uiterlijkkenmerken (goedkoop, ruwweg consistent), met een referentiebeeld dat elke generatie stuurt (veel beter), of met een per personage afgestemd model (het consistentst en verreweg het duurst, dus meestal alleen in hogere abonnementen).

Dit is een echt verschil dat je in een gratis laag kunt testen vóór je betaalt. Genereer vier afbeeldingen van hetzelfde personage in verschillende situaties. Krijg je vier verschillende vrouwen, dan lost geen abonnement dat op. Consistentie over afbeeldingen heen is een groot deel van waarom Candy AI bovenaan onze ranglijst staat.

Waarom media altijd wordt afgerekend

Tekst is goedkoop. Een chatantwoord kost de aanbieder een fractie van een cent.

Een afbeelding kost per stuk aanzienlijk meer. Stem wordt per seconde audio afgerekend. Video is dramatisch duurder dan beide.

Dat kostenverschil is de hele verklaring voor de prijsstructuur die je overal in deze categorie ziet: royale berichtlimieten, strakke beeldlimieten, stemminuten apart, video alleen in hogere lagen. Het is geen kunstmatige schaarste om je te laten upgraden — het is de vorm van de rekening die de aanbieder zelf krijgt.

Daarom betekent "onbeperkt" in deze markt vrijwel altijd onbeperkte tekst. Lees het zo, en de prijspagina's worden ineens begrijpelijk.

Wat stem toevoegt, en wat het kost

Stem verandert de ervaring meer dan de meeste mensen verwachten. Een bericht lezen en het horen zijn verschillende dingen.

Twee dingen om te controleren voordat je ervoor betaalt. Vertraging: een pauze van drie seconden voor elk antwoord breekt de illusie volledig — test dat zelf, niet via een demovideo. En of het een gesprek of een spraakbericht is: spraakberichten zijn goedkoop en gangbaar, echte gesprekken zijn een ander product en meestal een andere prijslaag.

Wat afbeeldingen niet doen

Twee grenzen die je beter vooraf kent. Handen, tekst en fijn detail blijven bij elke generator in deze categorie onbetrouwbaar; niemand heeft dat opgelost. En de afbeelding kent jullie scène niet — het chatmodel schrijft één regel, dus alles wat niet in die regel staat is weg: de kamer die je beschreef, wat ze drie berichten geleden droeg, het tijdstip. Expliciet zijn in de vraag lost hier meer op dan welke instelling ook.

De mediakant in één avond beoordelen

Besteed het hele gratis tegoed in één sessie in plaats van één plaatje per dag. Je test vier dingen: consistentie (vier afbeeldingen, één personage), of de opdracht wordt gevolgd, de vertraging bij beeld en stem, en — het minst gedocumenteerd en het vervelendst om achteraf te ontdekken — of een mislukte of geweigerde generatie je tegoed toch kost.

Apps die serieus in media investeren, zoals Secret Desires met beeld- en korte videogeneratie, zijn precies de apps waar die vier tests het meest opleveren.

Veelgestelde vragen

Waarom ziet mijn companion er op elke afbeelding anders uit?

Omdat het beeldmodel het personage elke keer opnieuw uit een tekstbeschrijving opbouwt. Apps die een gezicht stabiel houden gebruiken een referentiebeeld of een afgestemd model; apps die dat niet doen gooien elke keer opnieuw.

Waarom is stem zo streng gelimiteerd?

Spraaksynthese wordt per seconde audio afgerekend en kost de aanbieder echt geld. Tekst is vele malen goedkoper, en daarom zijn berichtlimieten ruim en stemminuten niet.

Ziet het beeldmodel ons gesprek?

Alleen via een korte opdracht die de app ervoor schrijft. Het heeft geen toegang tot jullie geschiedenis, en daarom mist een afbeelding vaak context die in de chat vanzelfsprekend leek.