Die nächste Ära des Wettbewerbs um Kameras: Der Kern des Rennens liegt in ihrer Fähigkeit zu verstehen.
Der Wettlauf um die beste Kamera wandelt sich hin zu einem Prozess, in dem es nicht mehr nur um technische Spezifikationen geht, sondern darum, die Szene zu verstehen und KI-gestützte intelligente Fotos aufzunehmen.
Die wichtigsten Dinge, die Sie wissen müssen
- Die Funktion des Sensors verschiebt sich von der Erfassung schöner Bilder für das menschliche Auge hin zur Bereitstellung sauberer Signale, die von der Maschine verarbeitet werden können, wodurch er zu einem unverzichtbaren Wahrnehmungsinstrument wird.
- Der Flaschenhals bei der Echtzeit-KI-Verarbeitung verlagert sich auf den Sensor, was den Bedarf an Lösungen wie On-Chip-Verarbeitung, ereignisbasierten Sensoren, universellen Verschlüssen und modifizierten HDR-Technologien zur Verbesserung der maschinellen Lesbarkeit erhöht.
- Der nächste Wettbewerb im Kamerabereich wird sich um das integrierte System drehen, das Sensor, Bildverarbeitung und periphere Computertechnik umfasst, wobei der Schwerpunkt auf der „Inferenzqualität“ als strategischer Priorität liegt, die über die traditionelle „Bildqualität“ hinausgeht.
Die Demonstration, die mich überzeugte, fand in einer Kunstgalerie statt, die ich selbst gebaut hatte.

Da wir kein Team von Guides stellen konnten, entwickelte ich ein Nebenprojekt als Ersatz. Es gab kein Eingabefeld oder Ähnliches. Man richtete einfach sein Handy auf etwas, und es zeigte einem an, was man gerade sah. Die Ausstellung endete zwar, aber die Leute nutzten es trotzdem weiter.
Sie lenkten seine Aufmerksamkeit auf die Gebäude, die Blumen, das Spielzeug ihrer Kinder, die Plakate auf der Straße, und nichts davon hatte etwas mit der Ausstellung zu tun.
Ohne dass sie jemand darum gebeten hätte, beschlossen sie, dass die Kamera ihnen die Welt erklären könne.
Diese Erwartung zu erfüllen, ist nun die Verantwortung der Branche, und dies geschieht zu einer Zeit, in der sich die künstliche Intelligenz von einem Trainingsproblem zu einem Inferenzproblem wandelt, bei dem der größte Teil der eigentlichen Arbeit auf dem Gerät selbst erledigt wird, während jemand sein Telefon auf eine nicht kooperative reale Welt richtet.
Ein Model benötigt andere Dinge von einem Bildausschnitt als das menschliche Auge: Kanten, an denen es sich orientieren kann, und Struktur, die es wiedererkennt, wenn das Bild überbelichtet oder unscharf ist. Die Farben und Kontraste, die ein Foto gut aussehen lassen, sind für ein Model oft hinderlich.
Der Sensor, den man für einen menschlichen Betrachter benötigt, und der Sensor, den man für ein Modell benötigt, erfordern unterschiedliche Konstruktionen.
Der Sensor ist zu einem Wahrnehmungsproblem geworden, und die Entwickler von Echtzeit-Bildverarbeitungssystemen beschäftigen sich heute in ähnlicher Weise damit wie früher die Fotografen.
Woher stammt der Sensor?
Der von Eric Fossum erfundene aktive Pixel-CMOS-Sensor, der Anfang der 1990er Jahre entwickelt wurde, ist der Grund dafür, dass sich heute in fast jeder Hosentasche eine leistungsfähige Kamera befindet.
Seine späteren Arbeiten schlagen eine völlig andere Richtung ein: den Quantenbildsensor, der einzelne Photonen zählt. Diese Entwicklung veranschaulicht die aktuelle Situation der künstlichen Intelligenz: Sie bewegt sich von der Erfassung eines Bildausschnitts, der dem Betrachter gefallen mag, hin zur Erfassung des reinsten Signals für die maschinelle Verarbeitung.
Der Sensor wird zum Wahrnehmungsinstrument, und die Fotografie ist nur eine seiner Anwendungsmöglichkeiten.
Warum verändert das Denken die Art der Arbeit?
Die Inferenz ist der Grund für die Dringlichkeit des Problems. Früher, als es bei KI primär um das Training ging, war die Rolle der Kamera indirekt: Sie lieferte Daten, die später in gemächlichem Tempo kategorisiert und aus denen gelernt wurde. Inferenz hingegen ist nicht langsam. Sie findet in Echtzeit auf einem leistungsschwachen und bereits überhitzten Gerät statt, wie es bei zeitkritischen KI-Anwendungen der Fall ist.
Wenn ein System etwas erkennen muss, während die Kamera noch darauf gerichtet ist, und reagieren muss, bevor es zu spät ist, ist das schwächste Glied das, was dem Modell vorausgeht, und es setzt die Grenze für alles, was das Produkt leisten kann.
Ein Teil der Branche setzt immer noch auf das Falsche. Man geht davon aus, dass ein ausreichend großes Modell die vom Kamerasignal gelieferten Daten automatisch bereinigt. Ich beobachte seit zwei Jahren, wie diese Annahme die Produktentwicklung behindert, und ich glaube nicht, dass sie den Gesetzen der Physik standhält.
Kein Größenmodell kann Details wiederherstellen, die durch Bewegungsunschärfe oder Spiegelungen bereits zerstört wurden oder die durch eine Beauty-Priorisierung verworfen wurden, bevor das Model überhaupt im Bild ist. Der Flaschenhals verlagert sich nun nach oben, zum Sensor und dem, was sich zwischen ihm und dem Model befindet.
Was genau bewirken die Geräte?
Einige Sensoren führen einen Teil der Datenverarbeitung direkt auf dem Chip durch, sodass die ersten Berechnungen erfolgen, bevor die Daten das Pixel-Array verlassen. Ereignisbasierte Sensoren, auch neuromorphe Sensoren genannt, erfassen nur die sich verändernden Teile der Szene. Dies ist für die Echtzeit-Erkennung deutlich besser geeignet als die Übertragung vollständiger Bilder. Global Shutter tragen ebenfalls dazu bei, Bewegungsartefakte zu reduzieren, die die Messwerte verfälschen können.
Selbst High Dynamic Range (HDR), das ursprünglich für die dramatische Darstellung des Himmels entwickelt wurde, wird nun neu kalibriert, um dem zu entsprechen, was das Modell bei hohem Kontrast klar erfassen kann. Trotz ihrer Unterschiede weisen all diese Technologien in dieselbe Richtung: hin zu einer Version der Welt, mit der das Modell umgehen kann.
Von der Identifizierung bis zum Schluss
Am intuitivsten lässt sich die visuelle Suche realisieren: Man richtet die Kamera auf ein Objekt und erhält eine Bezeichnung. Richtet man das Smartphone jedoch auf eine Speisekarte, wünscht man sich Hilfe bei der Auswahl des Gerichts; richtet man es auf ein Poster, wäre es hilfreich, den Termin im Kalender zu speichern. Die Objekterkennung ist nur der Anfang. Der Kern des Produkts liegt darin, zu wissen, was als Nächstes geschehen soll. Hier wird der Sensor zum ersten Glied in einer längeren Interpretationskette und leistet weit mehr als nur die reine Informationserfassung.
Ich hatte nie die Absicht, ein Kameraprodukt zu entwickeln; es begann als kostengünstige Möglichkeit, die Kosten für Guides für eine einzelne Ausstellung zu sparen. Doch dieses kleine Projekt hat mir gezeigt, dass dieser Instinkt bereits vorhanden ist. Die nächste Herausforderung in der Kamerawelt wird das Gesamtsystem betreffen: den Sensor, die Bildverarbeitung, die Peripheriegeräte , die Modellformatierung und die letztendliche Funktion des Systems.
Hardwarehersteller haben jahrelang an der Verbesserung der Bildqualität gearbeitet und müssen nun auch die Qualität der Signalverarbeitung ernst nehmen. Softwareentwickler dürfen die Signalerfassung nicht länger als fremdes Problem betrachten: Die Art und Weise, wie ein Signal erfasst und weitergeleitet wird, prägt das Ergebnis lange bevor der Nutzer es wahrnimmt. Die alten Grenzen zwischen Hardware und Software verlieren an Bedeutung, je tiefer wir in die Echtzeit-Wahrnehmung vordringen.
Hier ist noch Platz für Startups. Ihr Vorteil liegt in der schnellen Problemerkennung: Sie formulieren das Problem, bevor die großen Player ihre Diskussionen darüber beendet haben. Die Leistungsfähigkeit des etablierten Modells lässt sich immer schwerer verteidigen. Die Frage ist: Was passiert, wenn ein einzelnes System ein und dasselbe Ereignis erkennen, vorausdenken und darauf reagieren kann? Und wer wird als Erster ein voll funktionsfähiges Produkt auf den Markt bringen?
Menschliche Augen versus Maschinenverstand
Ich wette, die nächsten Jahre werden die Unternehmen in zwei Lager spalten: jene, die die Leistung für das menschliche Auge optimieren, und jene, die die Leistung für die maschinelle Lesbarkeit optimieren. Bei Flaggschiff-Smartphones überschneiden sich diese Ziele noch so stark, dass der Unterschied kaum noch erkennbar ist.
Strategisch gesehen haben sich diese Ziele jedoch bereits auseinanderentwickelt. Die nachhaltigste Position wird diejenige sein, die die chaotische Realität in das klarste Signal umwandeln kann, aus dem die Maschine Schlüsse ziehen kann.
Das beginnt mit dem Sensor.
Wir haben die besten Kamerahandys getestet, bewertet und in eine Rangliste aufgenommen.
Kommentarfunktion ist geschlossen.