Generatore di didascalie per immagini
Genera una bozza di didascalia per un'immagine con un modello locale nel browser.
Generatore di didascalie per immagini
Drop your files here
or choose files from your device
Come usare Generatore di didascalie per immagini
AI image captioner writes a short caption describing a photo using the ViT-GPT2 image captioning model, which runs in your browser after it downloads. Generation is limited to 80 new tokens, and the caption can be copied or downloaded as image-caption.txt. Captions can omit or invent details, so review them before publishing.
- Scegli un file di origine. Se lo strumento accetta più file, disponili nell'ordine desiderato.
- Controlla il formato di origine prima di eseguire l'operazione.
- Esegui il generatore di didascalie per immagini, esamina il risultato, poi usa i controlli disponibili per copiare o scaricare.
Cosa supporta questo strumento
Scarica un modello di inferenza al primo utilizzo. Chat e generazione richiedono WebGPU; i modelli di riconoscimento più piccoli usano WebAssembly del browser. L'output AI può omettere o inventare dettagli. Esaminalo prima dell'uso.
Limiti ed elaborazione
Le origini di testo sono limitate a 8.000 caratteri; la ricerca di immagini accetta fino a 20 immagini e una query di 500 caratteri. I modelli possono troncare i testi lunghi. I primi download possono raggiungere centinaia di MB e richiedono memoria del browser.
Origine di esempio
A useful tool makes everyday work easier. Review the results before sharing.
Domande frequenti
What AI model does the image captioner use?
It runs Xenova/vit-gpt2-image-captioning, a quantized image-to-text model, through a browser runtime. The model downloads on the first run and may remain in the browser cache for later captions on the same device.
Can the AI image captioner describe more than one image?
Each run captions the first image you select. To caption several photos, run the tool once per image and copy or download each caption separately.
Can the captioner read text or recognize people in an image?
It is a general captioning model, not an OCR or recognition tool. It produces a brief description of the scene, so add names, places, visible text and other context yourself.
Dove viene elaborato il mio input?
La modalità locale scarica modelli e risorse di runtime pubblici e mantiene l'input in questo browser. I modelli possono rimanere nella cache di questo dispositivo.
Quali sono i limiti di input?
Le origini di testo sono limitate a 8.000 caratteri; la ricerca di immagini accetta fino a 20 immagini e una query di 500 caratteri. I modelli possono troncare i testi lunghi. I primi download possono raggiungere centinaia di MB e richiedono memoria del browser.