Chào mừng bạn đến với TiemDienThoai.com
Kiến thức · Camera

Chế độ chân dung xoá phông bằng AI: không cần camera kép vẫn làm được

Cơ chế ước lượng độ sâu đơn mắt và phân vùng ngữ nghĩa giúp camera đơn xoá phông không cần dữ liệu thị sai.

Mục lục bài viết

Nhiều người vẫn nghĩ máy phải có hai camera sau mới xoá phông được, nhưng thực tế hàng loạt điện thoại tầm trung chỉ dùng một cảm biến chính vẫn cho ảnh chân dung mờ hậu cảnh khá mượt. Cơ chế đứng sau chuyện này là ước lượng độ sâu bằng trí tuệ nhân tạo thay vì đo khoảng cách vật lý qua hai ống kính, và cách làm này đang dần trở thành tiêu chuẩn kể cả trên camera trước chỉ có một thấu kính.

Camera kép làm gì khác với camera đơn

Với hai camera đặt lệch nhau vài milimet, máy chụp đồng thời hai khung hình từ hai góc nhìn hơi khác nhau, sau đó so sánh độ lệch vị trí của cùng một điểm ảnh giữa hai khung (gọi là disparity) để suy ra khoảng cách thực tế. Vật càng gần thì độ lệch giữa hai ảnh càng lớn, vật càng xa thì độ lệch càng nhỏ. Đây là nguyên lý stereo vision, gần giống cách hai mắt người ước lượng chiều sâu.

Camera đơn ước lượng độ sâu bằng cách nào

Khi chỉ có một ống kính, máy không có dữ liệu thị sai để tính toán trực tiếp. Thay vào đó, một mạng nơ-ron được huấn luyện trên hàng triệu cặp ảnh và bản đồ độ sâu tương ứng, học được các manh mối gián tiếp như kích thước tương đối của vật thể, độ mờ nét theo khoảng cách, góc phối cảnh, độ sắc nét của kết cấu bề mặt. Từ một khung hình duy nhất, mô hình này (gọi là monocular depth estimation) dự đoán mỗi điểm ảnh nằm gần hay xa ống kính bao nhiêu, dù không chính xác tuyệt đối như đo bằng cảm biến vật lý.

Vai trò của nhận diện chủ thể

Song song với bản đồ độ sâu, máy chạy thêm một mô hình phân vùng ngữ nghĩa (semantic segmentation) để khoanh vùng chính xác đâu là người, đâu là nền. Mô hình này được huấn luyện riêng để nhận diện đường viền cơ thể, khuôn mặt, tóc ở mức chi tiết pixel. Kết quả phân vùng được chồng lên bản đồ độ sâu thô để hiệu chỉnh lại ranh giới, vì bản đồ độ sâu một mình thường có độ phân giải thấp và viền không sắc nét.

Mô phỏng hiệu ứng bokeh

Sau khi có bản đồ độ sâu đã hiệu chỉnh, phần mềm áp một hàm làm mờ có cường độ tăng dần theo khoảng cách tới chủ thể, mô phỏng vòng tròn nhoè quang học (circle of confusion) mà một ống kính khẩu độ lớn thực sự tạo ra. Nhiều máy cho phép chọn khẩu độ ảo như f/1.8 hay f/4 ngay trong ứng dụng camera, thực chất chỉ là thay đổi thông số của thuật toán làm mờ chứ không liên quan đến khẩu độ vật lý của ống kính.

Hiểu nhầm thường gặp

“Không có camera kép thì chụp chân dung xoá phông chỉ là hiệu ứng giả, chất lượng kém hẳn”. Thực tế các mô hình ước lượng độ sâu đơn mắt hiện nay đã được huấn luyện đủ tốt để cho kết quả tương đương camera kép trong nhiều tình huống chụp thông thường, chỉ thua kém rõ rệt ở cảnh có nhiều chi tiết mảnh như tóc bay hay vật thể có lỗ hổng.

Xem thêm

Nội dung này thuộc cụm bài Chụp thiếu sáng & chân dung: tổng hợp bài viết. Xem thêm Chế độ chụp đêm (Night Mode) trên điện thoại hoạt động thế nào. Tham khảo thêm tại trang hỗ trợ Android chính thức của Google để có thông tin cập nhật chính thức về chủ đề này.

Lê Hoàng Nam - chuyên gia công nghệ điện thoại
Tác giả phụ trách chuyên mục

Chuyên gia nhiếp ảnh di động & hiệu năng — Từng thử nghiệm và đo hiệu năng hàng trăm mẫu điện thoại, tập trung vào camera, benchmark chip và tối ưu bộ nhớ.

Xem hồ sơ và chuyên môn →
Bình luận bài viết

Để lại bình luận

Thông tin liên hệ chỉ dùng để phản hồi, không hiển thị công khai.