Veo Và Google Flow: Tạo Video AI Từ Prompt Và Ảnh
Năm cách ra video bằng Veo và Google Flow: từ prompt thuần, từ ảnh có sẵn, đến dựng theo storyboard nhiều cảnh.
Bài viết có thể chứa liên kết tiếp thị (affiliate) — Kudomax có thể nhận hoa hồng khi bạn mua hàng qua các liên kết này, không phát sinh thêm chi phí cho bạn. Xem chính sách minh bạch.
Video quảng cáo đầu tiên mình thử làm bằng Veo chỉ mất một buổi chiều, thứ trước đây phải thuê quay dựng mất cả tuần. Không thay thế hoàn toàn được quay thật, nhưng đủ tốt cho rất nhiều nhu cầu nội dung ngắn hằng ngày. Bài này gom năm cách ra video, các bước bắt đầu với Flow và những giới hạn mình va phải sau nhiều lần đốt credit.

Veo và Google Flow là gì, khác nhau chỗ nào?
Veo là mô hình sinh video của Google DeepMind: nhận mô tả văn bản hoặc ảnh, trả về đoạn video ngắn, và từ bản Veo 3 thì sinh kèm cả âm thanh gồm tiếng động, nhạc nền lẫn thoại. Google Flow là công cụ dựng phim chạy trên nền Veo tại labs.google/flow: thay vì tạo từng đoạn rời rạc, Flow cho bạn quản lý dự án nhiều cảnh, nối cảnh, giữ nhân vật nhất quán giữa các cảnh và xuất thành phẩm hoàn chỉnh.
📌 Chưa chắc nên chọn gì? Đọc trước Học AI: Dùng Claude, ChatGPT, Gemini Đúng Việc — hướng dẫn tổng hợp của Kudomax về học ai.
Quyền dùng đi theo gói Google AI trả phí, mỗi lần sinh video trừ một lượng credit, hạn mức tùy gói. Ở thời điểm mình viết bài, tài khoản tại Việt Nam đăng nhập và dùng được bình thường.
Năm cách ra video?
- 1. Từ prompt thuần văn bản: mô tả cảnh quay mong muốn, Veo dựng video từ số 0, hợp cho ý tưởng chưa có hình ảnh tham chiếu.
- 2. Từ ảnh làm khung hình: đưa một ảnh làm khung đầu (thêm được khung cuối), mô tả chuyển động, video sinh ra giữ đúng bố cục và nhân vật trong ảnh gốc.
- 3. Từ nguyên liệu tham chiếu (ingredients): đưa ảnh nhân vật, đồ vật, bối cảnh riêng lẻ để Veo ghép vào cùng một cảnh, cách tốt nhất hiện có để giữ nhân vật đồng nhất qua nhiều đoạn.
- 4. Mở rộng video có sẵn: kéo dài cảnh tiếp nối từ đoạn đã sinh, giữ mạch chuyển động liên tục.
- 5. Dựng chuỗi cảnh trong SceneBuilder của Flow: xếp nhiều đoạn theo thứ tự kịch bản, mỗi cảnh một mô tả riêng, ghép lại thành video dài hơn.
Bắt đầu với Flow qua mấy bước?
- Bước 1: vào labs.google/flow, đăng nhập tài khoản có gói AI, tạo project mới.
- Bước 2: ở khung tạo, chọn chế độ: từ văn bản, từ ảnh làm khung hình, hoặc từ ingredients.
- Bước 3: gõ prompt rồi bấm tạo. Mỗi đoạn sinh ra dài khoảng 8 giây, thường có vài phương án để chọn.
- Bước 4: ưng đoạn nào thì thêm vào scene, dùng chức năng mở rộng để nối cảnh tiếp theo cho liền mạch.
- Bước 5: ghép đủ cảnh thì xuất video tải về, chèn chữ và nhạc bằng công cụ dựng quen tay như CapCut.
Mẹo viết prompt video để ra đúng ý?
Mô tả rõ góc máy, chuyển động camera và không khí cảnh quay, không chỉ mô tả nhân vật đang làm gì. Prompt như "một người đi bộ trên phố" ra kết quả rất chung chung, còn "máy quay theo sau một người đi bộ trên phố buổi tối, ánh đèn neon, nhịp chậm" cho kết quả sát ý hơn nhiều.
Công thức mình dùng: chủ thể + hành động + bối cảnh + góc máy và chuyển động camera + ánh sáng + phong cách. Với Veo 3 thêm được lớp âm thanh: mô tả tiếng động mong muốn, thoại đặt trong ngoặc kép. Prompt tiếng Anh hiện cho kết quả ổn định hơn tiếng Việt. Một prompt đầy đủ trông thế này:
Cinematic tracking shot: a street food vendor
grilling pork skewers at a night market in Hanoi,
neon signs, light rain, shallow depth of field,
slow push-in. Audio: sizzling meat, distant traffic.
Mỗi lần sinh đều trừ credit kể cả khi kết quả không dùng được, nên viết prompt kỹ ra giấy trước rồi hãy bấm tạo, đừng sửa mò từng chữ qua cả chục lượt sinh.
Ví dụ thật: clip quảng cáo 24 giây cho fanpage?
Clip gần nhất mình làm cho một fanpage bán đồ bếp gồm ba cảnh 8 giây. Cảnh mở: sản phẩm quay chậm trên nền bếp, dùng ảnh chụp sản phẩm thật làm khung hình đầu để giữ đúng hình dáng. Cảnh giữa: tay người dùng sản phẩm, tạo từ prompt thuần. Cảnh chốt: sản phẩm đặt giữa khung với khoảng trống phía trên, chữ khuyến mãi chèn sau bằng CapCut, vì chữ tiếng Việt để AI tự sinh gần như chắc chắn sai chính tả. Kịch bản ba cảnh viết theo khung quen dùng cho video bán hàng, bạn lấy được từ bài 5 framework viết content bán hàng rồi chuyển từng phần thành prompt.
Giới hạn hiện tại?
- Chữ trong video: chữ tiếng Việt trên biển hiệu, bao bì gần như luôn sai, giải pháp là để trống vị trí đó và chèn chữ ở khâu dựng.
- Tay và thao tác phức tạp: cầm nắm, đan ngón tay vẫn hay biến dạng, cảnh cận tay nên quay thật.
- Nhân vật đổi mặt giữa các lần sinh nếu không dùng ingredients; video nhiều cảnh có nhân vật xuyên suốt thì bắt buộc dùng cách này.
- Thoại tiếng Việt lúc đạt lúc không, giọng có thể lơ lớ; cần thoại chuẩn thì tắt thoại AI và lồng tiếng riêng khi dựng.
- Watermark ẩn SynthID được nhúng trong video để nhận diện nội dung AI; nội dung quảng cáo nên minh bạch chuyện dùng AI để tránh rắc rối về sau.
Nên tạo video trong ứng dụng Gemini hay trong Flow?
Veo dùng được ở hai nơi và chọn sai chỗ sẽ tốn thời gian: ứng dụng Gemini tạo nhanh từng clip đơn, Flow mới có bộ công cụ dựng nhiều cảnh.
- Dùng Veo trong ứng dụng Gemini nếu mỗi tuần chỉ cần vài clip đơn lẻ, muốn thử ý tưởng nhanh, không cần nối cảnh.
- Dùng Flow nếu làm video nhiều cảnh, cần giữ nhân vật nhất quán, hoặc sản xuất nội dung đều đặn cho một kênh.
Bước tiếp theo: chọn một sản phẩm hoặc chủ đề bạn đang làm nội dung, viết sẵn ba prompt cho ba cảnh rồi mới mở Flow, cách này tiết kiệm credit hơn hẳn vào tạo mò. Còn khi nguyên liệu của bạn là tài liệu chữ chứ không phải ý tưởng hình ảnh, chuyển sang dạng âm thanh với NotebookLM: biến tài liệu thành podcast tự động hợp hơn là cố ép thành video.




