Skip to main navigation Skip to search Skip to main content

Exploring Audio-Visual Fusion Methods in Foundation Model-Based Deception Detection

  • Jiaxiang Meng
  • , Hardik B. Sailor
  • , Qiongqiong Wang
  • , Tianchi Liu
  • , Kong Aik Lee
  • , Xingmei Wang

Research output: Chapter in book / Conference proceedingConference article published in proceeding or bookAcademic researchpeer-review

Abstract

The deception detection task aims to identify if a speaker is speaking truth or lie. It is a challenging problem due to limited training data and hence this poses a restriction for representation learning models to learn better features. Audio-visual multi-modal detection has gained significant attention for its superior performance compared to single-modality approaches. In practical scenarios, multi-modal integration can be challenging due to the distinct characteristics of each modality, making the fusion process difficult. In this paper, we employ the Querying Transformer (Q-former) to temporally align audio and visual features from foundation models and explore various methods to fuse these two modalities. Comprehensive experiments on the DOLOS dataset show that our proposed fusion technique outperforms systems based on individual audio and visual modalities. The experiments also indicate that early fusion using layer-bylayer alignment between the two modalities in the foundation model is not required. Instead, integrating over all layers of the two modalities yields the best performance.

Original languageEnglish
Title of host publication2025 Asia Pacific Signal and Information Processing Association Annual Summit and Conference, APSIPA ASC 2025
PublisherInstitute of Electrical and Electronics Engineers Inc.
Pages1964-1968
Number of pages5
ISBN (Electronic)9798331572068
DOIs
Publication statusPublished - Oct 2025
Event17th Asia Pacific Signal and Information Processing Association Annual Summit and Conference, APSIPA ASC 2025 - Singapore, Singapore
Duration: 22 Oct 202524 Oct 2025

Publication series

Name2025 Asia Pacific Signal and Information Processing Association Annual Summit and Conference, APSIPA ASC 2025

Conference

Conference17th Asia Pacific Signal and Information Processing Association Annual Summit and Conference, APSIPA ASC 2025
Country/TerritorySingapore
CitySingapore
Period22/10/2524/10/25

ASJC Scopus subject areas

  • Artificial Intelligence
  • Computer Science Applications
  • Hardware and Architecture
  • Signal Processing

Fingerprint

Dive into the research topics of 'Exploring Audio-Visual Fusion Methods in Foundation Model-Based Deception Detection'. Together they form a unique fingerprint.

Cite this