תמונה מדברת היא MP4 קצר שבו תצלום סטילס נראה מדבר בקצב של קול שכבר יש לכם. אתם מעלים תמונה אחת וקובץ אודיו אחד. המחולל מעריך את תנועת הפה מתוך הרצועה הזו וכותב פריימים חדשים. התמונה אינה פשוט מושמעת עם האודיו מעליה. תנועת תמונה לווידאו כללית, שממציאה תנועת מצלמה או מזג אוויר מפרומפט, היא משימה אחרת.
הקלט המועיל הוא תצלום שבו הפנים נראים בבירור, בתאורה טובה ובלי חיתוך דרך הפה. משקפי שמש, הסתרה כבדה, פרופיל קיצוני או פנים זעירים בתוך קהל מקשים על סנכרון השפתיים. זה רמז לאיכות, לא שער קשיח. סביבת העבודה תקבל בכל זאת קובץ שעומד בכללי הגודל והסוג. התוצאה נשארת הסתברותית. השיניים, הלשון וקצוות השפתיים יכולים לסטות. הזהות סביב הלסת יכולה להתרכך. אדם שני בפריים יכול לקחת תנועה שיורית. בדקו את ההורדה לפני פרסום.
Banana Pro AI מחייב לפי משך האודיו שהשרת מודד בהעלאה, ולא לפי השניות שהנגן בדפדפן מציג. 32 קרדיטים לשנייה ב-720 ו-48 קרדיטים לשנייה ב-1080. האורך המחויב נע בין שנייה אחת ל-60 פחות אחת. רצועות של 60 שניות ומעלה נדחות. קובץ MP3 בקצב סיביות משתנה בלי מטא-נתוני משך קריאים עלול להיכשל גם כשהתצוגה המקדימה נשמעת תקינה. טקסט הרמז האופציונלי יכול להגיע ל-300 תווים. v1 אינו מוסיף המרת טקסט לדיבור, שיבוט קול, seed או מסכה.