Manifest

Tal blir text. Inget mer.

Manifestet är måttstocken för varje beslut om Sorla.

En funktion, en inställning, en skärm eller en rad text som inte tjänar de här principerna hör inte hemma i Sorla, hur användbar den än vore någon annanstans.

Principerna

1. Ett syfte

Sorla gör tal till text där användaren redan arbetar. Varje funktion ska förbättra det flödet eller göra det mer tillförlitligt. Funktioner som skapar ett annat användningsområde hör inte hemma i Sorla.

2. Lokal behandling

Ljud och transkription ska behandlas på enheten och aldrig skickas iväg. Sorla ska inte kräva konto eller samla in användarbeteende. Nätverket får användas för den första modellhämtningen och för uppdateringar användaren uttryckligen begärt eller aktiverat. Dikteringen ska därefter fungera utan internet.

3. Snabbt till användbar text

Minimera tiden från aktivering till korrekt inklistrad text. Bedöm hastighet och träffsäkerhet tillsammans: en snabbare transkription är ingen förbättring om den skapar mer rättningsarbete. Start, diktering och inklistring ska hålla sina prestandabudgetar.

4. Lugn med tydlig återkoppling

Sorla ska inte stjäla fokus eller kräva uppmärksamhet utanför dikteringsflödet. Användaren ska kunna avgöra när appen lyssnar, bearbetar och är klar. Fel som hindrar eller riskerar resultatet ska framgå och gå att återhämta sig från. Diskretion får inte bli otydlighet.

5. Standardval före inställningar

Lös problem med genomtänkta standardbeteenden innan nya val införs. En inställning ska finnas när verkliga användarbehov kräver olika beteenden som inte kan förenas i ett bra standardval. Exponera inte tekniska beslut som produkten kan fatta själv.

6. Användarens ord

Sorla ska transkribera, inte redigera. Skiljetecken och versaler får göra talet läsbart, men funktioner får inte ändra användarens betydelse, ton eller ordval. Omskrivning, sammanfattning, översättning och tillagt innehåll ligger utanför uppgiften.

7. Bevara arbetet och möjliggör återhämtning

Bevara urklipp och fokus. Befintlig text får bara ersättas enligt användarens avsikt, exempelvis genom en aktiv markering. Om inklistringen misslyckas ska den senaste transkriptionen kunna återanvändas utan en ny diktering. Begränsa lagring och återhämtning till vad det aktuella flödet behöver.

8. Djup före bredd

Prioritera träffsäkerhet, tillförlitlighet och tillgänglighet framför fler funktioner, modeller och språk. Ett tillägg ska lösa ett påvisat problem, inte bara utöka utbudet. Nyttan behöver inte gälla majoriteten: att göra grundfunktionen tillgänglig för en mindre grupp kan väga tungt.

9. Liten, inbyggd, ärlig

Använd plattformens egna verktyg och etablerade beteenden. Håll resursanvändning, beroenden och bakgrundsarbete till det uppgiften kräver. Gör begränsningar och tekniska beroenden tydliga. Skilj mätbara resultat från ambitioner och dokumentera betydande avvägningar.

Utanför, enligt principerna

Funktionstestet

Ett förslag måste klara alla sex frågorna. Ett enda ”nej” betyder att det inte byggs, eller att något mindre byggs som klarar dem.

  1. Syfte. Gör det tal till text, där du är bättre för de flesta som använder Sorla?
  2. Standardval. Kan det fungera utan en ny inställning? Om inte, behöver verkliga människor verkligen olika svar?
  3. Integritet. Stannar varje ord och varje beteende på Macen?
  4. Snabbhet och lugn. Är diktering, start och kostnaden i vila oförändrade, och är Sorla lika tyst?
  5. Tydlighet. Kan en ny användare förstå det av en enda mening?
  6. Värde. Om det togs bort ett år senare, skulle folk sakna det?

Budgetar

Här blir principerna mätbara. En ändring som spräcker en budget väntar tills den inte gör det.

VadGräns
Från släpp till text (tio sekunders tal)under 0,5 s
Processor när Sorla inte används0 %
Inställningarhögst 10
Poster i menynhögst 8
Nätverkden första nedladdningen av modellen; därefter bara när användaren ber om det eller själv slår på det
Steg från installation till första dikteringinstallera, ge behörigheter, prata

Sorla står på talmodellen Klang Pianissimo av Klang AI AB (CC BY 4.0), konverterad till Core ML, på FluidAudio (Apache-2.0) och på KeyboardShortcuts (MIT).