Mensen gaan ervan uit dat een companion-app één intelligentie is die kan praten, tekenen en spreken. Het zijn drie of vier losse systemen die door de app aan elkaar zijn geknoopt, en de meeste frustraties aan deze kant komen uit de naden ertussen.
Drie motoren, één venster
Het taalmodel voert het gesprek. Het produceert tekst en verder niets.
Het beeldmodel is een compleet ander systeem. Het neemt een tekstbeschrijving en maakt daar een afbeelding van. Het heeft jullie gesprek nooit gezien.
Het spraaksysteem zet tekst om in audio. Ook apart, ook blind voor alles behalve de zin die het krijgt aangereikt.
Vraag je je companion om een foto, dan gebeurt dit: het taalmodel schrijft een korte beschrijving van de gevraagde afbeelding, de app plakt daar de opgeslagen uiterlijkkenmerken van het personage bij, die gecombineerde opdracht gaat naar het beeldmodel, en er komt een plaatje terug. De chat reageert vervolgens op een afbeelding die hij niet kan zien.
Die estafette is de bron van vrijwel elke klacht over media in deze categorie.
Waarom het gezicht steeds verandert
Omdat een beeldmodel jouw personage niet ophaalt, maar iemand genereert die bij een beschrijving past. "Lang donker haar, groene ogen, midden twintig" beschrijft miljoenen gezichten, en je krijgt er elke keer een ander.
Apps lossen dit in verschillende mate op: met opgeslagen uiterlijkkenmerken (goedkoop, ruwweg consistent), met een referentiebeeld dat elke generatie stuurt (veel beter), of met een per personage afgestemd model (het consistentst en verreweg het duurst, dus meestal alleen in hogere abonnementen).
Dit is een echt verschil dat je in een gratis laag kunt testen vóór je betaalt. Genereer vier afbeeldingen van hetzelfde personage in verschillende situaties. Krijg je vier verschillende vrouwen, dan lost geen abonnement dat op. Consistentie over afbeeldingen heen is een groot deel van waarom Candy AI bovenaan onze ranglijst staat.
Waarom media altijd wordt afgerekend
Tekst is goedkoop. Een chatantwoord kost de aanbieder een fractie van een cent.
Een afbeelding kost per stuk aanzienlijk meer. Stem wordt per seconde audio afgerekend. Video is dramatisch duurder dan beide.
Dat kostenverschil is de hele verklaring voor de prijsstructuur die je overal in deze categorie ziet: royale berichtlimieten, strakke beeldlimieten, stemminuten apart, video alleen in hogere lagen. Het is geen kunstmatige schaarste om je te laten upgraden — het is de vorm van de rekening die de aanbieder zelf krijgt.
Daarom betekent "onbeperkt" in deze markt vrijwel altijd onbeperkte tekst. Lees het zo, en de prijspagina's worden ineens begrijpelijk.
Wat stem toevoegt, en wat het kost
Stem verandert de ervaring meer dan de meeste mensen verwachten. Een bericht lezen en het horen zijn verschillende dingen.
Twee dingen om te controleren voordat je ervoor betaalt. Vertraging: een pauze van drie seconden voor elk antwoord breekt de illusie volledig — test dat zelf, niet via een demovideo. En of het een gesprek of een spraakbericht is: spraakberichten zijn goedkoop en gangbaar, echte gesprekken zijn een ander product en meestal een andere prijslaag.
Wat afbeeldingen niet doen
Twee grenzen die je beter vooraf kent. Handen, tekst en fijn detail blijven bij elke generator in deze categorie onbetrouwbaar; niemand heeft dat opgelost. En de afbeelding kent jullie scène niet — het chatmodel schrijft één regel, dus alles wat niet in die regel staat is weg: de kamer die je beschreef, wat ze drie berichten geleden droeg, het tijdstip. Expliciet zijn in de vraag lost hier meer op dan welke instelling ook.
De mediakant in één avond beoordelen
Besteed het hele gratis tegoed in één sessie in plaats van één plaatje per dag. Je test vier dingen: consistentie (vier afbeeldingen, één personage), of de opdracht wordt gevolgd, de vertraging bij beeld en stem, en — het minst gedocumenteerd en het vervelendst om achteraf te ontdekken — of een mislukte of geweigerde generatie je tegoed toch kost.
Apps die serieus in media investeren, zoals Secret Desires met beeld- en korte videogeneratie, zijn precies de apps waar die vier tests het meest opleveren.