From Video to Recipe: Leveraging Vision Language Models for Culinary Analysis

Abstract

Visual language models (VLMs) are increasingly driving transformation across multiple domains, including culinary research and food science. This study investigates the performance of open-weight large VLMs with Turkish language support in extracting recipes from culturally specific cooking videos. Experiments conducted on short-form culinary videos evaluate automated recipe generation, ingredient extraction, and cooking duration estimation, discussing future integration of retrieval-augmented generation (RAG).

Publication
4th International Congress on Food Researches, Sivas, Türkiye
Yunus Serhat Bıçakçı
Yunus Serhat Bıçakçı
Assistant Professor

Assistant Professor specializing in GeoAI, Multimodal Vision-Language Models, and Spatial Data Science.

Related