Nhận diện văn bản OCR và chú thích phiên âm
Cách Shaip cung cấp chú thích hộp giới hạn cấp độ từ + chú thích phiên âm cấp độ ký tự trên nhiều nguồn văn bản khác nhau — tài liệu in, chữ viết tay, biển báo, biển số xe, biên lai — được xây dựng thành bộ dữ liệu OCR và trí tuệ tài liệu cấp độ sản xuất với độ chính xác 99%.
Tổng Quan Dự Án
Khi công nghệ OCR không chỉ giới hạn ở các tài liệu in ấn đơn giản mà còn mở rộng sang xử lý văn bản trong các khung cảnh thực tế và thông tin tài liệu, khách hàng cần một quy trình chú thích có khả năng xử lý nhiều loại văn bản, phông chữ, hướng in, ngôn ngữ và điều kiện bề mặt khác nhau với độ chính xác cả về không gian và ký tự.
Shaip đã xây dựng quy trình chú thích hoàn chỉnh từ đầu đến cuối, bao gồm việc đặt khung giới hạn ở cấp độ từ, phiên âm ký tự chính xác, gắn thẻ đa thuộc tính và kiểm tra chất lượng kép về không gian + phiên âm — tạo ra các bộ dữ liệu OCR sẵn sàng cho mô hình trên hơn 10 loại nguồn văn bản.
Số liệu thống kê chính
Chú thích cho mỗi hình ảnh
Hàng trăm từ
Ngưỡng chính xác
99%
Nguồn văn bản
10 +
Lớp thuộc tính
5
Những thách thức
- Chú thích mọi trường hợp văn bản hiển thị ở cấp độ từ ngữ — hàng trăm từ trên mỗi hình ảnh dày đặc
- Kết hợp độ chính xác của hộp giới hạn không gian với phiên âm chính xác ở cấp độ ký tự song song
- Xử lý văn bản cong, bị biến dạng phối cảnh và xoay trên biển hiệu và nhãn sản phẩm
- Phiên âm mờ, độ tương phản thấp và bị che khuất một phần từ mà không cần đoán các ký tự khó đọc
- Quản lý văn bản đa ngôn ngữ và đa hệ chữ viết trong cùng một hình ảnh
Dung dịch
Chú thích không gian cấp độ từ
Mỗi đoạn văn bản hiển thị trong mỗi hình ảnh đều được chú thích riêng lẻ bằng một khung bao quanh được thiết kế chính xác ở cấp độ từ — ghi lại vị trí không gian chính xác của từng phần tử văn bản. Đối với những hình ảnh dày đặc như hóa đơn hoặc biểu mẫu, điều này có nghĩa là hàng trăm chú thích riêng lẻ cho mỗi hình ảnh, mỗi chú thích đều duy trì độ chính xác căn chỉnh theo đường cơ sở.
Phiên âm cấp độ ký tự
Cùng với khung bao quanh, người chú thích đã ghi chép chính xác nội dung văn bản của từng từ, bao gồm cả số, ký tự đặc biệt, dấu câu và các tổ hợp chữ số. Quy trình làm việc kép này — không gian + phiên âm — được thực hiện song song với các quy tắc nhất quán trên cả hai lớp.
Phạm vi phủ sóng đa nguồn
Phạm vi bao phủ của nhiều nguồn tài liệu đa dạng: tài liệu in, ghi chú viết tay, biển báo đường phố, nhãn sản phẩm, biển số xe, mặt tiền cửa hàng, bảng quảng cáo, biên lai, hóa đơn, thực đơn và các trường biểu mẫu. Mỗi loại nguồn tài liệu đều đi kèm với hướng dẫn chú thích riêng được điều chỉnh phù hợp với đặc điểm hình ảnh của nó.
Gắn thẻ thuộc tính 5 lớp
Mỗi vùng văn bản được chú thích đều được bổ sung các thuộc tính bao gồm hướng văn bản (ngang, dọc, chéo), ngôn ngữ và kiểu chữ, độ rõ nét của văn bản (dễ đọc, khó đọc, khó đọc), kiểu phông chữ (in ấn so với viết tay) và loại nền văn bản (đơn giản, có hoa văn, phức tạp). Lớp thuộc tính phong phú này cho phép mô hình được huấn luyện xử lý các điều kiện văn bản thực tế đa dạng, vượt xa các phương pháp nhận dạng ký tự quang học (OCR) tài liệu tiêu chuẩn.
Ngưỡng hiển thị & Kiểm tra chất lượng kép
Các hướng dẫn nghiêm ngặt quy định ngưỡng hiển thị tối thiểu — văn bản không thể đọc được sẽ được gắn cờ thay vì đoán, nhằm duy trì tính toàn vẹn của tập dữ liệu. Mỗi hình ảnh được chú thích đều trải qua quy trình kiểm tra chất lượng hai cấp độ, kết hợp xem xét độ chính xác của khung giới hạn và xác thực độ chính xác của bản ghi, với ngưỡng độ chính xác 99% trên cả hai lớp.
Phạm vi dự án
| Loại tập dữ liệu | Mức độ chú thích | nguồn | Thuộc tính | QA | tính chính xác |
|---|---|---|---|---|---|
| Nhận dạng ký tự quang học (OCR) và phiên âm. | Hộp văn bản + phiên âm ký tự | Hơn 10 loại nguồn | 5 lớp thuộc tính | Kiểm soát chất lượng không gian kép + phiên mã | 99% |
Kết quả
- Đã thành lập một quy trình phiên âm không gian cấp độ từ kép + cấp độ ký tự dành cho OCR AI
- Tiêu chuẩn hóa Phạm vi bao phủ hơn 10 nguồn văn bản bao gồm tài liệu, văn bản mô tả cảnh và chữ viết tay.
- Giao 5 lớp thuộc tính để định hướng, ngôn ngữ, độ rõ ràng, phông chữ và hình nền
- Duy trì Cổng có độ chính xác 99% trên cả hai lớp QA không gian và phiên âm.
- Đã kích hoạt cho khách hàng Số hóa tài liệu, nhận dạng ký tự quang học (OCR) trong lĩnh vực bán lẻ, định vị, ngân hàng và pháp lý. Ứng dụng AI
Nhìn chung, Shaip đã giúp chuyển đổi yêu cầu chú thích văn bản từ nhiều nguồn thành một quy trình OCR có cấu trúc, sẵn sàng cho sản xuất — một quy trình có khả năng hỗ trợ số hóa tài liệu, phát hiện văn bản trong cảnh, trí tuệ bán lẻ, tự động hóa ngân hàng và trí tuệ nhân tạo tuân thủ pháp luật với độ chính xác kép về không gian và phiên âm.
Shaip đã xử lý các trường hợp đặc thù của OCR mà hầu hết các nhà cung cấp khác không thể làm được — văn bản trên biển báo cong, chữ viết hỗn hợp, biên lai mờ, ghi chú viết tay. Quy trình kiểm tra chất lượng kép của họ trên cả khung giới hạn và bản ghi đã cung cấp cho chúng tôi dữ liệu huấn luyện mà chúng tôi có thể sử dụng.
— Giám đốc, Trí tuệ nhân tạo tài liệu