Watch demos on how to build & run AI-powered apps with Firebase at Demo Day '24. Watch now.

Questa pagina è stata tradotta dall'API Cloud Translation.

Generare testo da prompt multimodali utilizzando l'API Gemini

Quando chiami Gemini API dalla tua app utilizzando un SDK Vertex AI in Firebase, puoi chiedere al modello Gemini di generare del testo in base a un input multimodale. I prompt multimodali possono includere più modalità (o tipi di input), come testo, immagini, PDF, video e audio.

Per testare e eseguire l'iterazione sui prompt multimodali, ti consigliamo di utilizzare Vertex AI Studio.

Altre opzioni per lavorare con Gemini API

Facoltativamente, puoi provare una versione alternativa "Google AI" di Gemini API
per ottenere l'accesso senza costi (entro i limiti e se disponibile) utilizzando Google AI Studio e gli SDK client Google AI. Questi SDK devono essere utilizzati solo per la creazione di prototipi nelle app mobile e web.

Dopo aver acquisito familiarità con il funzionamento di un Gemini API, esegui la migrazione ai nostri SDK Vertex AI in Firebase (questa documentazione), che offrono molte funzionalità aggiuntive importanti per le app mobile e web, come la protezione dell'API da usi impropri tramite Firebase App Check e il supporto per file multimediali di grandi dimensioni nelle richieste.

Se vuoi, chiama Vertex AI Gemini API lato server (ad esempio con Python, Node.js o Go)
Utilizza gli SDK Vertex AI lato server, Firebase Genkit o Firebase Extensions per Gemini API.

Prima di iniziare

Se non l'hai ancora fatto, completa la guida introduttiva agli SDK Vertex AI in Firebase. Assicurati di aver eseguito tutte le seguenti operazioni:

Configura un progetto Firebase nuovo o esistente, ad esempio utilizzando il piano di prezzi Blaze e attivando le API richieste.
Collega la tua app a Firebase, inclusa la registrazione e l'aggiunta della configurazione Firebase.
Aggiungi l'SDK e inizializza il servizio Vertex AI e il modello generativo nella tua app.

Dopo aver collegato l'app a Firebase, aggiunto l'SDK e inizializzato il servizio Vertex AI e il modello generativo, puoi chiamare Gemini API.

Generare testo da testo e una singola immagine
Generare testo da testo e più immagini
Generare testo da testo e un video

Genera testo da testo e una singola immagine

Prima di provare questo esempio, assicurati di aver completato la sezione Prima di iniziare di questa guida.

Puoi chiamare Gemini API con prompt multimodali che includono sia il testo sia un singolo file (ad esempio un'immagine, come mostrato in questo esempio). Per queste chiamate, devi utilizzare un modello che supporti i prompt multimodali (come Gemini 1.5 Pro).

I file supportati includono immagini, PDF, video, audio e altro ancora. Assicurati di esaminare i requisiti e i consigli per i file di input.

Scegli se vuoi riprodurre la risposta in streaming (generateContentStream) o attendere la risposta finché non viene generato l'intero risultato (generateContent).

Streaming

Puoi ottenere interazioni più rapide non aspettando l'intero risultato della generazione del modello, ma utilizzando lo streaming per gestire i risultati parziali.

Senza streaming

In alternativa, puoi attendere l'intero risultato anziché lo streaming. Il risultato viene restituito solo dopo che il modello ha completato l'intero processo di generazione.

Scopri come scegliere un modello Gemini e, facoltativamente, una posizione appropriata per il tuo caso d'uso e la tua app.

Genera testo da testo e più immagini

Prima di provare questo esempio, assicurati di aver completato la sezione Prima di iniziare di questa guida.

Puoi chiamare Gemini API con prompt multimodali che includono sia testo che più file (ad esempio immagini, come mostrato in questo esempio). Per queste chiamate, devi utilizzare un modello che supporti i prompt multimodali (come Gemini 1.5 Pro).

I file supportati includono immagini, PDF, video, audio e altro ancora. Assicurati di esaminare i requisiti e i consigli per i file di input.

Scegli se vuoi riprodurre la risposta in streaming (generateContentStream) o attendere la risposta finché non viene generato l'intero risultato (generateContent).

Streaming

Puoi ottenere interazioni più rapide non aspettando l'intero risultato della generazione del modello, ma utilizzando lo streaming per gestire i risultati parziali.

Senza streaming

In alternativa, puoi attendere l'intero risultato anziché lo streaming. Il risultato viene restituito solo al termine dell'intera procedura di generazione.

Scopri come scegliere un modello Gemini e, facoltativamente, una posizione appropriata per il tuo caso d'uso e la tua app.

Genera testo da testo e un video

Prima di provare questo esempio, assicurati di aver completato la sezione Prima di iniziare di questa guida.

Puoi chiamare Gemini API con prompt multimodali che includono sia testo che un singolo video (come mostrato in questo esempio). Per queste chiamate, devi utilizzare un modello che supporti i prompt multimodali (come Gemini 1.5 Pro).

Assicurati di esaminare i requisiti e i consigli per i file di input.

Scegli se vuoi riprodurre la risposta in streaming (generateContentStream) o attendere la risposta finché non viene generato l'intero risultato (generateContent).

Streaming

Puoi ottenere interazioni più rapide non aspettando l'intero risultato della generazione del modello, ma utilizzando lo streaming per gestire i risultati parziali.

Senza streaming

In alternativa, puoi attendere l'intero risultato anziché lo streaming. Il risultato viene restituito solo dopo che il modello ha completato l'intero processo di generazione.

Scopri come scegliere un modello Gemini e, facoltativamente, una posizione appropriata per il tuo caso d'uso e la tua app.

Requisiti e consigli per i file di input

Consulta File di input supportati e requisiti per Vertex AI Gemini API per scoprire di più su quanto segue:

Diverse opzioni per fornire un file in una richiesta
Tipi di file supportati
Tipi MIME supportati e come specificarli
Requisiti e best practice per file e richieste multimodali

Cos'altro puoi fare?

Scopri come contare i token prima di inviare prompt lunghi al modello.
Configura Cloud Storage for Firebase in modo da poter includere file di grandi dimensioni nelle richieste multimodali e avere una soluzione più gestita per fornire file nei prompt. I file possono includere immagini, PDF, video e audio.
Inizia a pensare alla preparazione per la produzione, inclusa la configurazione di Firebase App Check per proteggere il Gemini API da abusi da parte di clienti non autorizzati.

Provare altre funzionalità di Gemini API

Crea conversazioni a più turni (chat).
Genera testo da prompt di solo testo.
Genera output strutturato (come JSON) da prompt di testo e multimodali.
Utilizza le chiamate di funzione per collegare i modelli generativi a sistemi e informazioni esterni.

Scopri come controllare la generazione di contenuti

Comprendi la progettazione dei prompt, tra cui best practice, strategie e prompt di esempio.
Configura i parametri del modello, come la temperatura e i token di output massimi.
Utilizza le impostazioni di sicurezza per regolare la probabilità di ricevere risposte che potrebbero essere considerate dannose.

Puoi anche sperimentare con i prompt e le configurazioni del modello utilizzando Vertex AI Studio.

Scopri di più sui modelli Gemini

Scopri i modelli disponibili per vari casi d'uso e le relative quote e prezzi.

Inviare un feedback sulla tua esperienza con Vertex AI in Firebase

Salvo quando diversamente specificato, i contenuti di questa pagina sono concessi in base alla licenza Creative Commons Attribution 4.0, mentre gli esempi di codice sono concessi in base alla licenza Apache 2.0. Per ulteriori dettagli, consulta le norme del sito di Google Developers. Java è un marchio registrato di Oracle e/o delle sue consociate.

Ultimo aggiornamento 2024-12-22 UTC.